La ressource la plus chere en IA aujourd'hui n'est pas le calcul. C'est la bande passante memoire, et presque tout est depense a deplacer une seule chose : le cache KV. Deux lancements des derniers mois attaquent ce goulot d'etranglement depuis des directions d'ingenierie opposees, le V4.1-Flash de DeepSeek et le HySparse2 de Xiaomi, et ensemble ils esquissent a quoi ressemble la prochaine ere de l'inference : des agents a un million de jetons qui tiennent dans des gigaoctets, pas des teraoctets.
1. D'abord, dimensionnons le probleme
Dans la couche d'attention d'un transformer, generer un jeton exige de lire les vecteurs cle/valeur de chaque jeton precedent. En attention complete avec 61 couches (DeepSeek-V1), 128 tetes d'attention et une dimension de tete fine de 128, le cache d'un seul jeton a precision quasi sans perte coute environ 380 KB sur toutes les couches. Multiplions par le contexte :
- 32K jetons : ~12 Go de cache KV
- 128K jetons : ~49 Go
- 1M jetons : ~389 Go
Ce dernier chiffre explique pourquoi le "contexte de 1M" etait du marketing jusqu'a cette annee. Ce n'est pas un probleme de capacite du modele, c'est un probleme de sous-systeme memoire : meme avec 8 To/s de bande passante HBM, diffuser 389 Go par jeton vous limite a environ 20 jetons/seconde, avant tout raisonnement.
2. DeepSeek-V4.1-Flash : coder le cache une fois, quantifier fort
La lignee de DeepSeek effondre ce tableau :
Deux mecanismes font le travail.
Codage KV incremental. Les couches anterieures de la pile agissent comme une hierarchie memoire : le codage n'est applique que sur une petite fenetre finale de couches, au lieu de recalculer toute la pile par jeton. Le contexte se construit par un petit "diff" par jeton, avec des structures de metadonnees indexant ce qui a deja ete code, de sorte que les invites systeme repetees et les sorties d'outils reutilisees sont codees une fois, pas a chaque tour.
Cache KV FP4 (E2M1) avec metadonnees FP8. DeepSeek-V4-Flash a livre des caches KV FP8 ; V4.1-Flash va plus loin et stocke la plupart des vecteurs caches dans des blocs E2M1 style NVFP4, reduisant encore de moitie l'empreinte de V4-Flash. Les elements sensibles ou a haute frequence restent en precision plus elevee, la ou se preserve l'essentiel de la qualite du recall.
Le resultat compose est environ 437x plus petit que V1 et 4x plus petit que V4-Flash, ce qui fait d'un contexte d'un million de jetons un working set de ~0,9 Go au lieu d'un petit centre de donnees.
Le but de tout cela, ce sont les agents. Les benchmarks auto-declares ou le contexte du harness (invite systeme, competences, definitions d'outils, memoire) eclate la requete reelle de l'utilisateur sont exactement la charge que visent le codage incremental et l'elimination de la redondance par reutilisation du cache : une session d'agent est en grande partie du texte passe-partout renvoye, et V4.1-Flash cesse de le payer a chaque fois.
3. Xiaomi HySparse2 : ne lis pas ce que tu n'utiliseras pas
Separement, le laboratoire agents de Xiaomi a publie HySparse2 (arXiv 2609.26368), une architecture d'attention sparse hybride concue pour un modele agent MoE de 80B (A3B actifs). La ou DeepSeek reduit le cache par jeton, HySparse2 reduit ce qui est lu par jeton. Mecanismes cles :
- Sparsity elastique au niveau des tetes. Au lieu d'une configuration de sparsity globale, chaque tete choisit son propre equilibre entre attention locale a fenetre glissante et recuperation semantique top-K. Les tetes de retention peuvent rester "chaudes" tandis que les tetes syntaxiques deviennent surtout locales.
- Plusieurs profileurs. Un petit passage de profilage categorise les jetons en roles semantiques locaux vs globaux, puis scinde le flux KV en voies paralleles : une voie locale-dense a grain fin et une voie globale grossiere, chacune avec sa propre politique.
- Prefill top-K + local entrelaces. Pendant le traitement de l'invite, l'attention alterne entre des blocs globaux de selection top-K et des blocs locaux denses a fenetre, de sorte que les hits au niveau de la page (depots de code, longs documents) ne deplacent pas le contexte local d'ou la generation continue reellement.
- Metadonnees KV selectionnees. Un index compact stocke separement sur le cache quantifie pilote la recuperation. L'ablation de Xiaomi montre que la justesse sur leur ensemble agent long-contexte chute de 27.32 a approximativement sans vs avec ; la voie de metadonnees est ce qui empeche le recall sparse de se degrader en silence sur les requetes de type aiguille.
- KV partage style MQA. Le cache est organise en grouped-query (style MQA) (KV partage par couche entre tetes de requete), rendant le cache de l'agent environ 4-4,5x plus petit qu'un agencement MLA standard a meme largeur.
A 1M jetons sur le modele 80B, avec KV FP8 : HySparse2 tient 2,69 Go vs 6,72 Go pour HySparse et 12,09 Go pour l'attention hybride a fenetre glissante, tout en faisant 5,02x moins de calcul de prefill et 2,92x moins de calcul de decode que le SWA hybride. Selon les evals de recuperation de Xiaomi (style RULER-v2 a 32K) : 58,45 pour HySparse2 vs 35,74 pour HySparse vs 32,61 pour fenetre glissante.
Note importante d'honnetete : les affirmations de million de jetons de Xiaomi reposent sur leur propre harnais d'eval contre des ensembles de recuperation synthetiques comme des variantes de RedPajama ; la verification independante par tiers du vrai recall a 1M de jetons reste mince. L'architecture est credible ; les chiffres d'extremite meritent le scepticisme habituel jusqu'a ce que des equipes independantes les reproduisent au-dela de 256K.
4. Les gains apparaissent-ils sur de vrais benchmarks d'agents ?
DeepSeek publie des face-a-face pour V4.1-Flash a effort de raisonnement complet :
Ce tableau contient deux histoires differentes. Sur Terminal-Bench 2.1, essentiellement le harnais agent coding/ops standard actuel, V4.1-Flash est mesure a 90,6, devancant Claude Opus 5 (89,1) et GPT-5.6 (88,8). Sur le plus dur Terminal-Bench 4.0, Opus 5 reste nettement devant (51,8 vs 31,2), ce n'est donc pas une revendication globale de dominance de frontiere. Mais la direction est sans ambiguite : un modele optimise en cache et fortement quantise est desormais competitif sur les benchmarks qui comptent vraiment pour ceux qui deployent des agents, pas seulement sur du Q&A statique.
5. Ce que cela signifie si vous construisez avec des modeles
- L'ingenierie du cache KV devient la vraie frontiere de l'optimisation d'inference. Le cout de servir un agent est domine par le contexte du harness (invite systeme + definitions d'outils MCP + memoire), qui dans une trace que j'ai mesuree etait 93 jetons de question utilisateur contre ~100K jetons de surcharge du harness par requete. Les architectures qui refusent de re-payer cela a chaque tour changent l'economie unitaire par ordres de grandeur.
- "Modele bon marche" ne signifie plus "modele bete". La correlation entre la tranche de prix d'un modele et sa position sur les benchmarks agents se brise : V4.1-Flash est positionne bien en dessous d'Opus 5 sur le cout mais se situe a peu pres a son niveau sur Terminal-Bench 2.1/DeepSWE/CyberGym.
- L'attention sparse est passee du papier a la production. HySparse2 montre la recette (melange de sparsity par tete + selection entrelacee + cache quantifie + metadonnees de recuperation) qui deviendra un defaut dans la prochaine generation de modeles agents a poids ouverts. Observez quels laboratoires adoptent des variantes en premier.
- La verification long-contexte doit encore etre gagnee. Le recall revendique a 1M de jetons doit etre traite comme une revendication d'architecture, pas comme une ancre ; exigez des reproductions independantes a 512K+ avant de construire des parcours produit qui dependent d'une recuperation de type aiguille dans une pile de 1M.
Si les trois dernieres annees portaient sur la mise a l'echelle des parametres, les trois prochaines semblent porter sur la mise a l'echelle de ce qui tient en memoire par dollar. DeepSeek et Xiaomi viennent de publier la preuve la plus solide a ce jour que c'est un probleme d'ingenierie resoluble, et que les equipes qui traitent le cache KV comme un sous-systeme de stockage de premiere classe, non comme un effet secondaire de l'attention, fixeront la courbe de prix que tous les autres suivront.
References
- Xiaomi AI (2026). "HySparse2: Hybrid Sparse Attention for Million-Token Agents." arXiv:2609.26368. URL : https://arxiv.org/abs/2609.26368
- Notes d'ingenierie d'origine de Xiaomi sur HySparse2 : https://originshq.com/blog/hysparse2-hybrid-sparse-attention-agents/ (analyse secondaire des ablations du papier et des chiffres KV a 1M de jetons)
- MindStudio (2026). "DeepSeek-V4.1-Flash KV Cache Compression." https://www.mindstudio.ai/blog/deepseek-v4-1-flash-kv-cache-compression
- NVIDIA (2024). "NVIDIA Blackwell Architecture Technical Brief : quantification NVFP4 (E2M1)." https://resources.nvidia.com/en-us-blackwell-architecture
- Video de couverture originale : "DeepSeek's New Model vs Xiaomi's Sparse Attention" https://youtu.be/85QP5JDZfQM (miniature utilisee avec credit)