Skip to content

Kontext-Kompression und MoA

源码版本v2026.7.20

Verantwortung

Zwei Dinge: (1) Wenn die Historie sich der Kontextobergrenze des Providers nähert, werden alte Nachrichten zusammengefasst/abgeschnitten, um Budget freizugeben (context_compressor); (2) optional aggregiert der Mixture-of-Agents-Pfad die Ausgaben mehrerer Modelle (moa_loop). Beide werden innerhalb der Hauptschleife aufgerufen und sind die Stützen, die «lange Konversationen am Laufen halten» und «Antworten stabiler machen».

Schlüsseldateien

Datenfluss

  1. Die Hauptschleife prüft jeden Turn, ob Kompression nötig ist (siehe _should_run_preflight_estimate:213).
  2. Wird die Schwelle getroffen, ruft der context_compressor auf:
  3. Der durch Kompression «neu geschaffene» Raum wird über iteration_budget.refund() (agent/iteration_budget.py) teilweise zurückgegeben, sodass die Hauptschleife zusätzliche Turns drehen darf.
  4. Wenn MoA aktiviert ist, ruft moa_loop in diesem Turn parallel mehrere Provider auf und aggregiert sie als Verstärkung oder Schiedsspruch der Hauptantwort.

Zusammenfassung

Der Kompressor ist die Lebenslinie langer Konversationen. Der zentrale Trade-off ist «was wegwerfen, was behalten» – Werkzeugaufrufe und Pfad-Erwähnungen werden bevorzugt erhalten, weil ihr Verlust in folgenden Turns zu «Amnesie» führt. MoA ist eine orthogonale, ein-/ausschaltbare Verstärkung. Beide verändern die Struktur der Hauptschleife nicht, sondern klinken sich nur zum richtigen Zeitpunkt ein.

Inoffizielle Community-Lernseite. Basiert auf dem MIT-lizenzierten NousResearch/hermes-agent-Quellcode.