Die teuerste Ressource in der KI ist derzeit nicht Rechenleistung. Es ist die Speicherbandbreite, und fast alles davon fließt in das Bewegen einer einzigen Sache: des KV-Cache. Zwei Veröffentlichungen der letzten Monate greifen diesen Engpass aus entgegengesetzten Engineering-Richtungen an, DeepSeeks V4.1-Flash und Xiaomis HySparse2, und zusammen skizzieren sie, wie die nächste Ära der Inferenz aussieht: Agenten mit einer Million Token, die in Gigabyte passen, nicht in Terabyte.
1. Zuerst: das Problem bemessen
In der Attention-Schicht eines Transformers erfordert das Erzeugen eines Tokens das Lesen der Key/Value-Vektoren jedes vorhergehenden Tokens. Bei voller Attention mit 61 Schichten (DeepSeek-V1), 128 Attention-Heads und feiner Head-Dimension von 128 kostet der Cache eines einzelnen Tokens bei nahezu verlustfreier Präzision grob 380 KB über alle Schichten. Multiplizieren mit dem Kontext:
- 32K Token: ~12 GB KV-Cache
- 128K Token: ~49 GB
- 1M Token: ~389 GB
Diese letzte Zahl ist der Grund, warum "1M-Kontext" bis zu diesem Jahr Marketing war. Es ist kein Problem der Modellfähigkeit, sondern ein Problem des Speichersubsystems: selbst bei 8 TB/s HBM-Bandbreite begrenzt dich das Streamen von 389 GB pro Token auf grob 20 Token/Sekunde, vor jedem Denken.
2. DeepSeek-V4.1-Flash: Cache einmal codieren, hart quantisieren
DeepSeeks Abstammung kollabiert diese Tabelle:
Zwei Mechanismen leisten die Arbeit.
Inkrementelle KV-Codierung. Frühere Schichten im Stack wirken wie eine Speicherhierarchie: Die Codierung wird nur auf ein kleines finales Schichtenfenster angewendet, statt den gesamten Stack pro Token neu zu berechnen. Kontext wird durch ein winziges "Diff" pro Token aufgebaut, mit Metadatenstrukturen, die indizieren, was bereits codiert wurde, sodass wiederholte System-Prompts und wiederverwendete Tool-Ausgaben einmal codiert werden, nicht pro Turn.
FP4 (E2M1) KV-Cache mit FP8-Metadaten. DeepSeek-V4-Flash kam mit FP8-KV-Caches; V4.1-Flash geht weiter und speichert die meisten gecachten Vektoren in NVFP4-artigen E2M1-Blöcken, was die Fußabdruck von V4-Flash erneut halbiert. Empfindliche oder hochfrequente Elemente bleiben in höherer Präzision, wo der Großteil der Recall-Qualität erhalten bleibt.
Das kombinierte Ergebnis ist grob 437x kleiner als V1 und 4x kleiner als V4-Flash, was einen Millionen-Token-Kontext zu einem Working Set von ~0.9 GB macht statt zu einem kleinen Rechenzentrum.
Der Sinn dahinter sind Agenten. Selbstdeklarierte Benchmarks, bei denen der Harness-Kontext (System-Prompt, Skills, Tool-Definitionen, Speicher) die eigentliche Benutzerabfrage bei weitem überragt, sind genau die Workload, die inkrementelle Codierung und Cache-Wiederverwendungs-Redundanzeliminierung adressieren: Eine Agent-Session besteht meist aus erneut gesendetem Boilerplate, und V4.1-Flash hört auf, dafür wiederholt zu zahlen.
3. Xiaomi HySparse2: lies nicht, was du nicht nutzt
Separat veröffentlichte Xiaomis Agent-Lab HySparse2 (arXiv 2609.26368), eine hybride Sparse-Attention-Architektur für ein 80B-MoE (A3B aktiv) Agent-Modell. Wo DeepSeek den Cache pro Token verkleinert, verkleinert HySparse2 das, was pro Token gelesen wird. Kernmechaniken:
- Elastische Head-Level-Sparsity. Statt einer globalen Sparsity-Konfiguration wählt jeder Head sein eigenes Gleichgewicht zwischen lokaler Sliding-Window-Attention und semantischem Top-K-Retrieval. Retention-Heads können "heiß" bleiben, während syntaktische Heads meist lokal werden.
- Mehrere Profiler. Ein kleiner Profiling-Durchlauf kategorisiert Token in lokale vs globale semantische Rollen und teilt dann den KV-Stream in parallele Lanes: eine feinkörnige lokal-dichte Lane und eine grobe globale Lane, jeweils mit eigener Politik.
- Verschachteltes Top-K + lokales Prefill. Während der Prompt-Verarbeitung wechselt Attention zwischen globalen Top-K-Auswahlblöcken und dichten lokalen Fensterblöcken, sodass Page-Level-Treffer (Code-Repos, lange Dokumente) nicht den lokalen Kontext verdrängen, von dem die Generierung tatsächlich weiterläuft.
- KV-ausgewählte Metadaten. Ein separat gespeicherter kompakter Index über den quantisierten Cache treibt das Retrieval. Xiaomis Ablation zeigt, dass die Correctness auf ihrem Long-Context-Agentenset von 27.32 auf ungefähr ohne vs mit fällt; die Metadaten-Lane hält Sparse-Recall davor, sich bei Needle-artigen Abfragen still zu verschlechtern.
- MQA-artiges gemeinsames KV. Der Cache ist als Grouped-Query (MQA-artig) organisiert (pro Schicht gemeinsames KV über Query-Heads), was den Cache des Agenten bei gleicher Breite etwa 4-4.5x kleiner macht als ein Standard-MLA-Layout.
Bei 1M Token am 80B-Modell mit FP8-KV hält HySparse2 2.69 GB vs 6.72 GB für HySparse und 12.09 GB für hybride Sliding-Window-Attention, bei 5.02x weniger Prefill-Compute und 2.92x weniger Decode-Compute als hybrides SWA. Laut Xiaomis Retrieval-Evals (RULER-v2-artig bei 32K): 58.45 für HySparse2 vs 35.74 für HySparse vs 32.61 für Sliding-Window.
Wichtige Ehrlichkeitsanmerkung: Die Millionen-Token-Behauptungen von Xiaomi stützen sich auf ihren eigenen Eval-Harness gegen synthetische Retrieval-Sets wie RedPajama-Varianten; unabhängige Drittanbieter-Verifikation des echten 1M-Token-Recalls ist noch dünn. Die Architektur ist glaubwürdig; die Endpunktzahlen verdienen die übliche Skepsis, bis unabhängige Teams sie über 256K hinaus replizieren.
4. Zeigen sich die Gewinne in echten Agent-Benchmarks?
DeepSeek veröffentlicht Head-to-Heads für V4.1-Flash bei voller Reasoning-Anstrengung:
In dieser Tabelle stecken zwei verschiedene Geschichten. Auf Terminal-Bench 2.1, im Wesentlichen dem aktuellen Standard-Agent-Harness für Coding/Ops, wird V4.1-Flash mit 90.6 gemessen und übertrifft Claude Opus 5 (89.1) und GPT-5.6 (88.8). Auf dem schwereren Terminal-Bench 4.0 bleibt Opus 5 deutlich vorn (51.8 vs 31.2), es ist also keine pauschale Behauptung von Frontier-Dominanz. Aber die Richtung ist eindeutig: Ein cache-optimiertes, stark quantisiertes Modell ist jetzt konkurrenzfähig auf den Benchmarks, die für Leute, die Agenten deployen, wirklich zählen, nicht nur bei statischem Q&A.
5. Was das bedeutet, wenn du mit Modellen baust
- KV-Cache-Engineering wird zur wahren Grenze der Inferenzoptimierung. Die Kosten für das Servieren eines Agenten werden vom Harness-Kontext dominiert (System-Prompt + MCP-Tool-Definitionen + Speicher), der in einem Trace, den ich maß, 93 Token Benutzerfrage vs ~100K Token Harness-Overhead pro Request war. Architekturen, die sich weigern, das jeden Turn neu zu bezahlen, verändern die Stückökonomie um Größenordnungen.
- "Billiges Modell" bedeutet nicht mehr "dummes Modell". Die Korrelation zwischen Preiskategorie eines Modells und seiner Agent-Benchmark-Position bricht auf: V4.1-Flash liegt preislich weit unter Opus 5, steht aber bei Terminal-Bench 2.1/DeepSWE/CyberGym ungefähr auf dessen Niveau.
- Sparse Attention ging vom Paper zur Produktion. HySparse2 zeigt das Rezept (Head-Sparsity-Mix + verschachtelte Auswahl + quantisierter Cache + Retrieval-Metadaten), das in der nächsten Generation offener Agent-Modelle Standard wird. Beobachte, welche Labs zuerst Varianten übernehmen.
- Long-Context-Verifikation muss noch verdient werden. Behaupteter 1M-Token-Recall sollte als Architektur-Behauptung behandelt werden, nicht als Anker; fordere unabhängige Replikationen bei 512K+, bevor du Produktpfade baust, die von Needle-im-1M-Stack-Retrieval abhängen.
Wenn die letzten drei Jahre um das Skalieren von Parametern gingen, sehen die nächsten drei danach aus, als gingen sie um das Skalieren dessen, was pro Dollar in den Speicher passt. DeepSeek und Xiaomi haben gerade die stärksten Beweise veröffentlicht, dass dies ein lösbares Engineering-Problem ist, und dass Teams, die den KV-Cache als Speichersubsystem erster Klasse behandeln, nicht als Nebeneffekt der Attention, die Preiskurve setzen, der alle anderen folgen.
Referenzen
- Xiaomi AI (2026). "HySparse2: Hybrid Sparse Attention for Million-Token Agents." arXiv:2609.26368. URL: https://arxiv.org/abs/2609.26368
- Xiaomis Origin-Engineering-Notizen zu HySparse2: https://originshq.com/blog/hysparse2-hybrid-sparse-attention-agents/ (Sekundäranalyse der Paper-Ablations und der 1M-Token-KV-Zahlen)
- MindStudio (2026). "DeepSeek-V4.1-Flash KV Cache Compression." https://www.mindstudio.ai/blog/deepseek-v4-1-flash-kv-cache-compression
- NVIDIA (2024). "NVIDIA Blackwell Architecture Technical Brief: NVFP4 (E2M1)-Quantisierung." https://resources.nvidia.com/en-us-blackwell-architecture
- Original-Covervideo: "DeepSeek's New Model vs Xiaomi's Sparse Attention" https://youtu.be/85QP5JDZfQM (Thumbnail mit Quellenangabe verwendet)