Qwen3.8-Max: Qwen setzt auf autonome KI für Coding, Forschung und reale Arbeitsabläufe

Veröffentlicht am 03.08.2026

Qwen3.8-Max – A New Bar for Coding and Cowork

Das Qwen-Team hat mit Qwen3.8-Max sein bislang leistungsfähigstes KI-Modell vorgestellt. Der Schwerpunkt liegt dabei nicht allein auf besseren Antworten oder höheren Benchmarkwerten. Das Modell soll vor allem komplexe Aufgaben über lange Zeiträume hinweg bearbeiten, Zwischenergebnisse selbst überprüfen und am Ende möglichst direkt nutzbare Resultate liefern.

Qwen3.8-Max basiert auf der Architektur von Qwen3.5 und verfügt nach Angaben des Herstellers über insgesamt 2,4 Billionen Parameter, von denen pro Verarbeitungsschritt rund 95 Milliarden Parameter aktiv sind. Besonders bemerkenswert: Erstmals will Qwen die Modellgewichte eines Modells der Max-Klasse öffentlich zur Verfügung stellen. Die Veröffentlichung auf Hugging Face und ModelScope ist laut Ankündigung für die darauffolgende Woche geplant.

Mehr als nur Code generieren

Beim Thema Programmierung möchte Qwen3.8-Max deutlich über klassische Coding-Assistenten hinausgehen. Das Modell soll nicht nur einzelne Funktionen schreiben oder Fehler in bestehendem Code finden, sondern komplette Projekte selbstständig planen, umsetzen, testen und weiterentwickeln können.

Als Beispiel nennt Qwen das Projekt „oh-my-cli". Qwen3.8-Max arbeitete dabei über mehr als zehn Tage autonom an einem selbstoptimierenden Entwicklungsprozess. Neue Anforderungen wurden in GitHub-Issues umgewandelt, automatisch von Agenten übernommen, implementiert und anschließend über Tests, Vorschauen und Continuous-Integration-Prüfungen kontrolliert.

Nach rund 16 Tagen vollständig autonomer Arbeit umfasste das Repository laut Qwen:

Entscheidend ist dabei weniger die reine Zahl der Änderungen als der zugrunde liegende Kreislauf: Das Modell wertete Rückmeldungen und Testergebnisse aus, leitete daraus neue Aufgaben ab und versuchte anschließend, das eigene System zu verbessern.

Forschungsarbeit reproduziert und anschließend verbessert

In einem weiteren Experiment erhielt Qwen3.8-Max lediglich eine wissenschaftliche Veröffentlichung mit dem Titel „Unified Data Selection for LLM Reasoning" sowie Zugriff auf GPUs. Starter-Code oder eine vorbereitete Trainingsumgebung gab es nach Angaben des Unternehmens nicht.

Das Modell musste deshalb die gesamte technische Pipeline selbst aufbauen: von der Datenverarbeitung über das Training bis zur Evaluation. Innerhalb von ungefähr fünf Tagen beziehungsweise 125 Stunden soll Qwen3.8-Max rund 7.600 Codezeilen geschrieben, mehr als 1.100 Aktionen ausgeführt und 33 GPU-Trainingsläufe durchgeführt haben.

Zunächst rekonstruierte das Modell die zentralen Ergebnisse der Forschungsarbeit. Anschließend startete es einen eigenen Verbesserungsprozess:

Hypothese aufstellen, Code schreiben, Training ausführen, Ergebnisse analysieren und einen neuen Versuch starten.

Dabei untersuchte das Modell 18 eigene Verbesserungsideen. Am Ende soll eine neu entwickelte Methode auf dem Mathematik-Benchmark AIME24 eine um 2,7 Prozentpunkte bessere Leistung erreicht haben als das Verfahren aus der ursprünglichen Veröffentlichung.

Das Beispiel zeigt, in welche Richtung Qwen denkt: KI-Modelle sollen künftig nicht nur Forschung zusammenfassen, sondern selbstständig Experimente reproduzieren, Fehler analysieren und neue Ansätze ausprobieren.

Besser als 87 Prozent der menschlichen Teams

Auch in einem realen Online-Wettbewerb wurde Qwen3.8-Max getestet. Beim WWW2025 Multimodal Dialogue Intent Recognition Challenge mussten Textnachrichten und Screenshots aus Kundendienstgesprächen ausgewertet werden, um die Absicht der jeweiligen Nutzer zu erkennen.

An dem Wettbewerb nahmen 526 menschliche Teams teil. Qwen3.8-Max entwickelte innerhalb eines Zeitlimits von 24 Stunden selbstständig eine multimodale Lösung.

Für die Textanalyse kombinierte das Modell unter anderem BERT, MacBERT und RoBERTa. Für die Auswertung der Screenshots kamen Qwen2.5-VL-7B und ein Chinese-CLIP-Modell zum Einsatz. Die Ergebnisse wurden anschließend über ein gewichtetes Abstimmungssystem zusammengeführt.

Über 45 Einreichungen hinweg soll die Genauigkeit von zunächst 0,60 auf 0,853 gestiegen sein. Damit übertraf das System laut Qwen 458 der 526 Teams – und damit rund 87 Prozent des Teilnehmerfeldes.

Benchmark-Ergebnisse von Qwen3.8-Max im Vergleich zu anderen Modellen
Quelle: Qwen Team, „Qwen3.8-Max: A New Bar for Coding and Cowork", qwen.ai, https://qwen.ai/blog?id=qwen3.8, abgerufen am 3. August 2026.

Qwen3.8-Max soll auch klassische Büroarbeit übernehmen

Neben Softwareentwicklung und Forschung richtet Qwen den Blick stark auf reale Arbeitsabläufe. Dafür wurde das Reinforcement-Learning-Training auf unterschiedliche Arbeitsumgebungen, Dateistrukturen, Aufgabentypen und Agentensysteme ausgeweitet.

Das Modell wurde unter anderem mit QwenWork, Claude Code, Codex, OpenClaw und Hermes getestet. Ziel ist, dass Qwen3.8-Max nicht nur innerhalb eines speziell angepassten Systems funktioniert, sondern mit verschiedenen Agenten-Frameworks vergleichbare Ergebnisse erzielt.

Qwen nennt eine Reihe von Beispielen aus unterschiedlichen Berufsgruppen:

Ein Compliance-System soll in mehreren hundert Dokumenten innerhalb von weniger als einer Stunde 1.284 relevante Vertragsklauseln gefunden haben. Ein vollständiger manueller Review würde nach Einschätzung des Unternehmens normalerweise mehrere Tage benötigen.

Für eine digitale Banking-Anwendung erstellte das Modell einen interaktiven Prototyp mit acht Bildschirmansichten und einem konsistenten Designsystem. Laut Qwen waren dafür keine nachträglichen Überarbeitungsrunden notwendig.

In einem weiteren Beispiel verarbeitete das Modell mehr als hundert Dokumente von Lebensmittellieferanten und entwickelte daraus ein Menü mit 26 Gerichten. Dabei wurden Kalorienwerte, Herkunft der Zutaten und ein vorgegebenes Verhältnis zwischen Warenkosten und Verkaufspreis berücksichtigt.

Diese Beispiele stammen allerdings direkt vom Hersteller. Unabhängige Prüfungen der zugrunde liegenden Arbeitsabläufe oder der behaupteten Zeitersparnisse werden in der Veröffentlichung nicht genannt.

Hunderte KI-Agenten für eine quantitative Handelsstrategie

Besonders stark setzt Qwen3.8-Max auf sogenannte Dynamic Workflows. Das Modell kann dabei größere Aufgaben in Teilprobleme zerlegen und zahlreiche Unteragenten parallel einsetzen.

Bei der Entwicklung einer ETF-Rotationsstrategie soll Qwen3.8-Max aus einer kurzen Aufgabenbeschreibung einen vollständigen Forschungsprozess aufgebaut haben. Dazu gehörten die Datenbeschaffung, die Entwicklung von Faktoren, Backtests und mehrere Optimierungsrunden.

Als das Modell Anzeichen für eine Überanpassung erkannte, entfernte es nach Angaben von Qwen selbstständig redundante Faktoren und änderte die Validierungsmethode.

Für eine breitere Faktorensuche zerlegte es sechs grundlegende Strategiefamilien – darunter Momentum, Value, Qualität und Sentiment – in jeweils 50 Forschungsrichtungen. Rund 330 Unteragenten führten daraufhin ungefähr 6.000 Backtests durch.

Solche Ergebnisse sollten nicht als Nachweis für eine profitable reale Anlagestrategie verstanden werden. Backtests hängen stark von Datenwahl, Zeitraum, Gebührenannahmen und Validierungsmethode ab. Das Experiment soll in erster Linie zeigen, wie Qwen3.8-Max umfangreiche Forschungsprozesse organisieren kann.

Vom fehlerhaften Chipdesign zur optimierten Schaltung

Eines der technisch interessantesten Experimente betrifft die Entwicklung eines Hardwarebeschleunigers für kryptografische Berechnungen. Qwen3.8-Max erhielt lediglich eine grundlegende Aufgabenbeschreibung, leere RTL-Modulvorlagen und eine automatisierte Testumgebung.

Anschließend arbeitete das Modell selbstständig mit Simulations-, Synthese- und Chipdesign-Werkzeugen wie Icarus Verilog, Yosys und OpenROAD.

Die erste funktionsfähige Version der Schaltung benötigte laut Qwen 8.298 Logikgatter. Über rund 500 Interaktionsschritte und 71 Evaluationen hinweg reduzierte das Modell die Schaltung auf 678 Gatter.

Der größte Fortschritt entstand durch eine grundlegende algorithmische Änderung: Ein aufwendiger Modulo-Divider wurde durch ein iteratives Shift-Subtract-Verfahren ersetzt. Später entfernte das Modell redundante Register, führte Module zusammen und teilte Recheneinheiten zwischen verschiedenen Komponenten.

Auch das physische Layout wurde deutlich kleiner. Die Chipfläche sank nach Herstellerangaben von 106 × 106 Mikrometern auf 46 × 46 Mikrometer. Das entspricht einer Reduktion von rund 81 Prozent. Gleichzeitig soll die finale Version bei 500 MHz ohne Timing-Verletzung funktioniert haben.

Ein Jahr E-Commerce in mehr als 2.000 Simulationsrunden

Wie gut ein Modell langfristige wirtschaftliche Entscheidungen treffen kann, untersuchte Qwen mit einer einjährigen E-Commerce-Simulation. Qwen3.8-Max erhielt ein Startkapital von 100.000 Yuan und musste mehrere virtuelle Onlineshops betreiben.

Das Modell traf Entscheidungen zu Produktauswahl, Einkauf, Lagerbestand, Preisen, Retouren und Verhandlungen mit Lieferanten. Zusätzlich enthielt die Simulation saisonale Nachfrageschwankungen, Lieferkettenprobleme und 152 betrügerische Händler.

Nach einem simulierten Jahr erreichte Qwen3.8-Max laut Veröffentlichung einen Gesamtwert von 416.252 Yuan. Das entspricht dem 4,16-Fachen des Startkapitals. Das Ergebnis soll 38 Prozent über dem zweitplatzierten GLM 5.2 und 152 Prozent über Qwen3.7-Max gelegen haben.

Qwen hebt vor allem hervor, dass das Modell seine Verhandlungs- und Einkaufsstrategie während der mehr als 2.000 Interaktionsrunden weiterentwickelte, anstatt an einer zu Beginn festgelegten Strategie festzuhalten.

Multimodale Agenten mit visueller Selbstkontrolle

Qwen3.8-Max verarbeitet nicht nur Text und Code, sondern auch Bilder, Videos, Benutzeroberflächen und komplexe Dokumente. Nach Angaben des Unternehmens kann das Modell Berichte mit mehr als 200 Seiten analysieren oder Videos mit einer Gesamtdauer von über 100 Stunden in eine durchsuchbare Wissensstruktur umwandeln.

Eine zentrale Rolle spielt dabei die visuelle Rückkopplung. Das Modell soll während der Arbeit seine eigenen Zwischenergebnisse betrachten und kontrollieren können. Erkennt es beispielsweise eine falsch ausgerichtete Oberfläche, ein fehlerhaft platziertes Objekt oder eine nicht funktionierende Interaktion, kann es den Arbeitsplan ändern und das Ergebnis korrigieren.

Mit RecreationBench führt Qwen zudem einen eigenen Benchmark für sogenannte Hybrid Agents ein. Dabei darf ein Modell eine Anwendung lediglich über deren Benutzeroberfläche bedienen. Ohne Quellcode und ohne Internetzugriff muss es anschließend versuchen, die Anwendung für Windows, macOS, Ubuntu, Android oder das Web nachzubauen.

Für die Integration multimodaler Funktionen in vorhandene Agentensysteme veröffentlicht Qwen außerdem die Erweiterungsbibliothek Qwen-MM-Plugins. Sie soll unter anderem Bild- und Videoverarbeitung, visuelle Werkzeuge, multimodales Gedächtnis sowie Funktionen für Blender- und CAD-Anwendungen bereitstellen.

Verfügbarkeit und API-Unterstützung

Qwen3.8-Max ist zunächst über QwenCloud verfügbar. Die Plattform unterstützt Schnittstellen, die mit den Chat-Completions- und Responses-APIs von OpenAI sowie mit dem API-Protokoll von Anthropic kompatibel sind.

Dadurch soll sich das Modell unter anderem mit Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw verbinden lassen.

Über den Parameter reasoning_effort können Entwickler den Rechenaufwand steuern:

Die Veröffentlichung der offenen Modellgewichte auf Hugging Face und ModelScope wurde für die auf die Ankündigung folgende Woche in Aussicht gestellt.

Einordnung: Beeindruckende Beispiele, aber viele Hersteller-Benchmarks

Qwen3.8-Max zeigt, wohin sich leistungsfähige KI-Agenten entwickeln: Statt lediglich auf einzelne Anfragen zu reagieren, sollen sie Projekte über Stunden oder Tage verfolgen, Werkzeuge bedienen, Fehler erkennen und ihre Vorgehensweise anpassen.

Die präsentierten Coding-, Forschungs- und Hardwareexperimente sind technisch beeindruckend. Dennoch müssen die Ergebnisse mit Vorsicht interpretiert werden. Ein Teil der Benchmarks wurde intern von Qwen entwickelt, während bei anderen Tests unterschiedliche Agenten-Frameworks, Bewertungsmodelle oder Laufzeitlimits verwendet wurden.

Die Werte sind deshalb nicht immer unmittelbar miteinander vergleichbar. Zudem stammen die Fallstudien und Leistungsangaben aus der offiziellen Produktvorstellung des Herstellers und wurden nicht durchgehend unabhängig bestätigt.

Trotzdem ist die angekündigte Veröffentlichung der Modellgewichte besonders relevant. Sollte Qwen tatsächlich ein Modell dieser Größenordnung als Open-Weight-Version bereitstellen, könnten Forschung und Unternehmen dessen Fähigkeiten genauer untersuchen, eigene Infrastruktur aufbauen und die Herstellerangaben unabhängig überprüfen.

Quelle: Qwen Team – Qwen3.8-Max: A New Bar for Coding and Cowork

← Zurück zur Übersicht

Das könnte Sie auch interessieren