DeepSeek V4.1 Flash: Weniger Kontextspeicher, mehr Spielraum für KI-Agenten

Veröffentlicht am 10.09.2026

DeepSeek V4.1 Flash: Weniger Kontextspeicher, mehr Spielraum für KI-Agenten

KI-Agenten müssen bei längeren Aufgaben immer mehr Informationen im Blick behalten. DeepSeek setzt mit V4.1 Flash deshalb beim Kontextspeicher an: Eine neue Architektur soll dessen Bedarf deutlich senken und zugleich starke Ergebnisse bei Programmierung und Büroaufgaben liefern. Das Modell verarbeitet Text und Bilder sowie bis zu eine Million Tokens Kontext. Was hinter den Effizienzangaben steckt und warum die Benchmarks eine differenzierte Betrachtung verdienen.

Ein KI-Agent, der ein Softwareprojekt bearbeitet, sammelt schnell einen umfangreichen Arbeitsverlauf: Quellcode, Anweisungen, Werkzeugausgaben und Ergebnisse früherer Schritte. Diese Informationen müssen nicht nur ins Kontextfenster passen. Ihre Verarbeitung und Wiederverwendung kosten auch Rechenleistung und Speicher. Genau an diesem Engpass setzt DeepSeek V4.1 Flash an.

Im vorliegenden technischen Bericht und der zugehörigen Modellbeschreibung stellt DeepSeek ein multimodales Modell mit bis zu einer Million Tokens Kontext vor. Es verarbeitet Text und Bilder und erzeugt Text. Die zentrale Neuerung ist jedoch der Umgang mit dem sogenannten KV-Cache: DeepSeek will den Speicherbedarf dieses Kontext-Zwischenspeichers erheblich reduzieren und gleichzeitig die Leistungsfähigkeit gegenüber V4 Flash steigern.

Warum der Kontextspeicher so wichtig ist

Der KV-Cache hält bereits berechnete Informationen aus dem bisherigen Kontext bereit. Dadurch muss das Modell beim Erzeugen weiterer Tokens nicht alles erneut berechnen. Bei langen Eingaben und umfangreichen Agentenverläufen wird dieser Zwischenspeicher allerdings selbst zu einem relevanten Kostenfaktor.

DeepSeek unterscheidet dabei zwei Bereiche. Der globale KV-Cache liegt während des Betriebs im schnellen Beschleunigerspeicher. Persistente Cache-Daten werden dagegen im Arbeitsspeicher des Hostsystems oder auf SSDs aufbewahrt, um bereits verarbeitete Kontextabschnitte später wiederzuverwenden.

Für den globalen KV-Cache nennt der Bericht 890 Byte pro Token. Das entspreche ungefähr einem Viertel des Bedarfs von DeepSeek V4 Flash bei gleicher Kontextlänge. Der persistente KV-Cache soll sogar auf etwa ein Achtel schrumpfen. Diese Angaben beziehen sich auf bestimmte Cache-Bereiche, nicht auf den gesamten Speicherbedarf des Modells. Auch Modellgewichte und weitere Betriebsdaten benötigen weiterhin Platz.

Weniger doppelte Daten, gezieltes Neuberechnen

Hinter den Einsparungen steckt eine Kombination mehrerer Verfahren. „Compressed Sparse Attention 2“, kurz CSA2, ermöglicht es verschiedenen Modellschichten, globale Cache-Daten gemeinsam zu nutzen. Teilweise werden auch die bereits ausgewählten Kontextpositionen wiederverwendet. So vermeidet das Modell doppelte Speicherung und wiederholte Arbeit.

Hinzu kommt eine kompakte FP4-Darstellung für den Hauptanteil des globalen KV-Caches. Vereinfacht gesagt werden die betreffenden Zahlenwerte mit weniger Bits gespeichert. Das spart Platz, muss aber so umgesetzt werden, dass die geringere Präzision die Modellqualität möglichst wenig beeinträchtigt.

Beim persistenten Cache geht DeepSeek einen weiteren Schritt: Das Verfahren „SWA Bounded Replay“ rekonstruiert benötigte lokale Aufmerksamkeitszustände näherungsweise aus einem begrenzten, jüngeren Kontextabschnitt. Bestimmte Zwischenergebnisse müssen deshalb nicht dauerhaft auf SSD gespeichert werden. Der Ansatz tauscht einen Teil des Speicherbedarfs gegen zusätzliche Berechnung beim Wiederaufnehmen des Kontexts.

DeepSeek berichtet von nur geringen Qualitätseinbußen in den untersuchten Situationen. Zugleich nennt das Unternehmen ausdrücklich offene Robustheitsfragen: Die Auswahl relevanter Kontextstellen und die näherungsweise Rekonstruktion könnten in bislang ungetesteten Grenzfällen zu schlechteren Ergebnissen führen.

Großes Modell mit selektivem Recheneinsatz

V4.1 Flash besitzt laut Bericht 552 Milliarden Backbone-Parameter. Hinzu kommen 196 Milliarden Parameter des separat ausgewiesenen Engram-Speichermoduls. Die Zahl von 552 Milliarden beschreibt somit nicht sämtliche Komponenten zusammen.

Als Mixture-of-Experts-Modell nutzt V4.1 Flash pro Token nur einen Teil seiner Experten. Eine kausale Encoder-Decoder-Architektur unterscheidet außerdem zwischen dem Verarbeiten der Eingabe und dem Erzeugen der Ausgabe. Beim sogenannten Prefill werden laut DeepSeek acht Milliarden Parameter pro Token aktiviert, beim anschließenden Decoding 16 Milliarden.

Das ist vor allem für Aufgaben interessant, bei denen sehr umfangreiche Eingaben vergleichsweise kurzen Antworten gegenüberstehen. Weniger aktive Parameter beim Einlesen sind allerdings keine direkte Messung der gesamten Laufzeit oder Stromkosten. Ebenso wenig machen sie aus dem vollständigen Modell ein kleines System für gewöhnliche Endgeräte.

Das Vortraining erfolgte den Unterlagen zufolge auf einem multimodalen Korpus mit 45 Billionen Tokens. Beim anschließenden Training betont DeepSeek vor allem größere und stärker automatisierte Datenpipelines für Agentenaufgaben. Das grundsätzliche Verfahren aus überwachtem Feintuning, Reinforcement Learning und nachfolgender Destillation bleibe etablierten Ansätzen verpflichtet.

Gute Agentenwerte, aber keine pauschale Spitzenposition

In den veröffentlichten Herstellertests erzielt V4.1 Flash unter anderem 90,6 Prozent bei Terminal-Bench 2.1, 74,2 Prozent bei DeepSWE v1.1 und 54,8 Prozent bei AutomationBench. Der Vorgänger V4 Flash erreicht in derselben Übersicht 82,7, 54,4 beziehungsweise 37,7 Prozent. Das spricht innerhalb dieser Tests für deutliche Fortschritte bei terminalbasierten Aufgaben, Softwareentwicklung und Automatisierung.

Das Leistungsbild ist dennoch nicht einheitlich. Bei Terminal-Bench 4.0 erreicht V4.1 Flash 31,2 Prozent und bleibt damit hinter mehreren der aufgeführten Konkurrenzmodelle. DeepSeek räumt selbst ein, dass bei besonders anspruchsvollen Aufgaben weiterhin Abstand zu führenden geschlossenen Systemen besteht.

Auch die Testbedingungen verdienen Aufmerksamkeit. Die veröffentlichten Instruct-Ergebnisse wurden mit maximalem Reasoning-Aufwand ermittelt. Dieser lässt sich beim Modell auf einer Skala von 1 bis 100 einstellen. Hohe Benchmark-Werte belegen daher nicht automatisch dieselbe Leistung bei besonders knappen Rechenbudgets.

Darüber hinaus beeinflusst die eingesetzte Agentenumgebung das Ergebnis. Bei DeepSWE v1.1 schwanken die ausgewiesenen Werte für dasselbe Modell je nach Umgebung zwischen 65,5 und 74,2 Prozent. Werkzeuge, Steuerung und Einbindung gehören folglich zur Leistungsbewertung dazu. Die beiden vorliegenden Dokumente stammen zudem vom Hersteller; eine unabhängige Überprüfung liefern sie nicht.

Was die Veröffentlichung praktisch bedeutet

Laut beigefügter Hugging-Face-Modellbeschreibung stehen das Repository und die Modellgewichte unter der MIT-Lizenz. Die Unterlagen beschreiben außerdem Referenzcode für das Eingabeformat, Hinweise zur lokalen Inferenz und Anleitungen zum Nachstellen von DeepSWE-Ergebnissen.

Für Entwickler ist vor allem die Kombination aus großem Kontextfenster, Bildverarbeitung und reduziertem Cache-Bedarf interessant. Sie könnte umfangreiche Agentenabläufe wirtschaftlicher machen. Wie groß dieser Vorteil tatsächlich ausfällt, hängt jedoch von Hardware, Eingabelängen, Parallelbetrieb und eingesetzter Software ab. Ein auf ein Viertel reduzierter globaler Cache bedeutet nicht automatisch ein Viertel der Gesamtkosten.

DeepSeek V4.1 Flash zeigt damit einen wichtigen Entwicklungsansatz: Leistungsfähigere Agenten brauchen neben guten Antworten auch einen effizienteren Umgang mit ihrer wachsenden Arbeitsgrundlage. Die vorliegenden Ergebnisse sind dafür vielversprechend. Ob die Einsparungen und die Zuverlässigkeit unter realen Einsatzbedingungen zusammen überzeugen, müssen praktische Tests zeigen.

Mit V4.1 Flash stellt DeepSeek ein multimodales KI-Modell für lange Agentenaufgaben vor. Bis zu eine Million Tokens Kontext und ein deutlich kleinerer KV-Cache sollen den Betrieb effizienter machen. Herstellertests zeigen Fortschritte bei Coding und Automatisierung, lassen aber auch Leistungsgrenzen erkennen.

Das Wichtigste in Kürze

DeepSeek setzt bei V4.1 Flash auf einen Engpass langer KI-Agentenaufgaben: den Speicher für bereits verarbeiteten Kontext. Das multimodale Modell unterstützt laut den vorliegenden Herstellerunterlagen bis zu eine Million Tokens, verarbeitet Text und Bilder und erzeugt Textausgaben.

Die wichtigsten Zahlen im Überblick

  • Globaler KV-Cache: 890 Byte pro Token – etwa ein Viertel des Werts von V4 Flash
  • Persistenter KV-Cache: rund ein Achtel des bisherigen Bedarfs
  • Parameter: 552 Milliarden Backbone-Parameter, dazu 196 Milliarden Engram-Speicher
  • Aktive Parameter: 8 Milliarden pro Token beim Prefill, 16 Milliarden beim Decoding
  • Benchmarks: 90,6 Prozent bei Terminal-Bench 2.1, 74,2 Prozent bei DeepSWE v1.1
  • Lizenz: MIT – Repository und Modellgewichte offen verfügbar

Möglich machen die Einsparungen unter anderem gemeinsam genutzte Cache-Daten über mehrere Modellschichten (CSA2), eine kompakte FP4-Darstellung und die näherungsweise Rekonstruktion lokaler Aufmerksamkeitszustände („SWA Bounded Replay“). Beim schwierigeren Terminal-Bench 4.0 erreicht das Modell 31,2 Prozent und bleibt damit hinter mehreren Konkurrenzmodellen zurück. Alle ausgewiesenen Instruct-Ergebnisse wurden mit maximalem Reasoning-Aufwand ermittelt; auch die verwendete Agentenumgebung beeinflusst die Werte deutlich.

Für Entwickler könnte V4.1 Flash besonders dort interessant sein, wo lange Kontexte häufig wiederverwendet werden. Die Cache-Einsparungen sind allerdings nicht mit gleich großen Einsparungen bei den Gesamtkosten gleichzusetzen, und DeepSeek benennt mögliche Qualitätseinbußen in ungetesteten Grenzfällen.

Alle Hintergründe und Details in der Langfassung lesen →

Quellen

  1. DeepSeek V4.1 Flash – DeepSeek

← Zurück zur Übersicht

Das könnte Sie auch interessieren