MiniMax H3: Offenes KI-Modell erzeugt 2K-Videos mit Bild, Text und Stereo-Sound
Veröffentlicht am 01.08.2026
MiniMax stellt mit H3 ein neues multimodales KI-Modell vor, das die bislang häufig getrennten Bereiche Bildgenerierung, Videoproduktion, Audiogenerierung und Medienbearbeitung in einem gemeinsamen System zusammenführen soll. Das Modell kann Informationen aus Texten, Bildern, Videos und Audiodateien gleichzeitig verarbeiten und daraus neue Videos mit einer Länge von bis zu 15 Sekunden erstellen.
Die Ausgabe soll standardmäßig in einer Auflösung von bis zu 2K möglich sein. Zusätzlich erzeugt H3 den passenden Ton direkt als natives Stereo-Audio. Damit möchte MiniMax das Modell nicht nur als klassischen Text-zu-Video-Generator positionieren, sondern als umfassendes Werkzeug für professionelle Medienproduktion.
Mehr als ein gewöhnlicher Text-zu-Video-Generator
Viele bisherige KI-Videomodelle arbeiten nach einem relativ einfachen Prinzip: Nutzer geben eine Textbeschreibung oder ein Ausgangsbild ein, woraufhin das Modell daraus einen kurzen Videoclip erzeugt.
H3 soll deutlich weiter gehen. Das Modell kann verschiedene Eingabequellen miteinander kombinieren und dabei auch die Beziehungen zwischen diesen Quellen berücksichtigen.
Ein Nutzer könnte beispielsweise:
- die Kamerabewegung aus einem vorhandenen Video übernehmen,
- eine Person aus einem Foto als Hauptfigur verwenden,
- eine separate Audiodatei als Gesang oder Stimme einfügen,
- und das gewünschte Ergebnis anschließend in natürlicher Sprache beschreiben.
MiniMax zeigt dafür ein Beispiel, bei dem die Kamerabewegung aus einem Referenzvideo, eine Figur aus einem Bild und der Gesang aus einer Audiodatei gemeinsam in ein neues Video übertragen werden. Nutzer müssen dabei keine speziellen technischen Funktionen auswählen. Stattdessen sollen sie die gewünschte Verbindung der Medien einfach sprachlich beschreiben können.
Dieser Ansatz ist ein zentraler Bestandteil von H3: Nicht die Auswahl eines bestimmten Werkzeugs oder Generierungsmodus soll im Vordergrund stehen, sondern die kreative Absicht des Nutzers.
Text, Bild, Video und Audio in einem gemeinsamen Kontext
MiniMax bezeichnet diese Fähigkeit als multimodales Kontextverständnis. H3 betrachtet die einzelnen Eingaben nicht isoliert, sondern versucht, einen gemeinsamen Zusammenhang zwischen ihnen herzustellen.
Das Modell soll unter anderem verstehen können:
- welche Figur aus einem Bild übernommen werden soll,
- welche Bewegung aus einem Video als Vorlage dient,
- welche Stimme oder Geräuschkulisse verwendet werden soll,
- wie sich Audio und Bild zeitlich aufeinander beziehen,
- und welche Elemente im Ergebnis verändert oder beibehalten werden müssen.
Gerade bei komplexeren Produktionen könnte dies die Arbeit vereinfachen. Anstatt einzelne Schritte in unterschiedlichen KI-Tools auszuführen, sollen sich größere Teile des Produktionsprozesses innerhalb eines Modells abbilden lassen.
Langfristig sieht MiniMax Videomodelle deshalb nicht mehr nur als Generatoren einzelner Clips. Sie könnten sich zu Werkzeugen entwickeln, die Nutzer während eines vollständigen kreativen Prozesses begleiten – von der ersten Idee über die Gestaltung bis zur finalen Überarbeitung.
Native Stereo-Audiospur statt nachträglicher Vertonung
Eine weitere Besonderheit von H3 ist die gemeinsame Erzeugung von Bild und Ton. Das Modell kann Videos mit einer nativen Stereo-Audiospur erstellen.
Stimmen, Musik und Soundeffekte werden dabei laut MiniMax nicht als vollständig getrennte Aufgaben behandelt. Stattdessen werden unterschiedliche Audioarten gemeinsam modelliert. Dadurch sollen Bild und Ton besser aufeinander abgestimmt sein.
Bei einem generierten Werbeclip könnte H3 beispielsweise gleichzeitig:
- die Bewegungen eines Produkts animieren,
- passende Umgebungsgeräusche erzeugen,
- Musik hinzufügen,
- Sprache oder Gesang generieren,
- und die Audioelemente zeitlich mit dem Video synchronisieren.
Das könnte besonders für Social-Media-Videos, Werbeanzeigen, Produktpräsentationen und kurze Filmsequenzen interessant sein. In solchen Bereichen besteht ein fertiger Clip selten nur aus bewegten Bildern. Auch Musik, Sprache, Geräusche und visuelle Texte müssen zusammenpassen.
MiniMax nennt zahlreiche kommerzielle Einsatzbereiche
MiniMax richtet H3 ausdrücklich auf die professionelle Content-Produktion aus. Als mögliche Anwendungsgebiete nennt das Unternehmen unter anderem Werbung, Markenkommunikation, E-Commerce, Produktdesign, Benutzeroberflächen, Spieleentwicklung und Filmproduktion.
Zu den gezeigten Beispielen gehören:
- animierte Filmtitel,
- bewegte Werbeplakate,
- Produkt- und Modevideos,
- Benutzeroberflächen für Spiele,
- Produktwebseiten,
- Markenanimationen,
- sowie Videos für Werbung und Onlinehandel.
Ein wichtiger Schwerpunkt liegt auf der korrekten Darstellung von Text und Markenelementen. Gerade Schriftzüge, Logos und Produktdetails bereiten generativen Videomodellen bislang häufig Schwierigkeiten. Buchstaben verändern sich während einer Bewegung, Logos werden verfälscht oder kleinere Details verschwinden zwischen einzelnen Frames.
MiniMax erklärt, H3 sei speziell auf eine zuverlässigere Text- und Markendarstellung ausgelegt. Ob das Modell diese Qualität auch über die vom Hersteller ausgewählten Beispiele hinaus erreicht, müssen allerdings unabhängige Tests zeigen.
Ein Modell für viele bislang getrennte Aufgaben
Die technische Grundidee von H3 besteht darin, möglichst viele Aufgaben bereits während des Trainings miteinander zu verbinden.
Bei bisherigen Modellen existieren häufig unterschiedliche Speziallösungen für:
- Text-zu-Bild,
- Text-zu-Video,
- Bildbearbeitung,
- Videoüberarbeitung,
- Bewegungsübertragung,
- Stilübertragung,
- Referenzbilder,
- Audiogenerierung,
- Sprachsynthese,
- Musikgenerierung,
- und Soundeffekte.
MiniMax sieht diese starke Aufteilung als Einschränkung. Sie erschwere nicht nur die Bedienung, sondern begrenze auch die Fähigkeit eines Modells, Wissen aus einer Aufgabe auf eine andere zu übertragen.
H3 wurde deshalb von Beginn an als allgemeineres Modell trainiert. Text-zu-Bild, Text-zu-Video, Text-zu-Audio sowie verschiedene Formen der Bearbeitung und Referenzübernahme sollen nicht als voneinander isolierte Funktionen betrachtet werden.
Die Beziehungen zwischen Ausgangsmaterial und gewünschtem Ergebnis werden stattdessen durch natürliche Sprache beschrieben. Sprache dient damit als gemeinsame Schnittstelle zwischen den unterschiedlichen Medien und Aufgaben.
Die Technik hinter MiniMax H3
MiniMax nennt mehrere zentrale Technologien, die H3 ermöglichen sollen.
Contextual Omni Representation
Die sogenannte Contextual Omni Representation soll komplexe Zusammenhänge zwischen den Eingaben beschreiben.
Das System analysiert nicht nur, was in einem Bild oder Video zu sehen ist. Es erfasst auch, wie verschiedene Elemente miteinander verbunden sind. Dazu gehören beispielsweise die Beziehung zwischen einer Figur und ihrer Stimme, der Zusammenhang zwischen mehreren Szenen oder die zeitliche Abstimmung von Musik, Sprache und Bewegung.
Nach Angaben von MiniMax können die analysierten Ausgangsdaten zunächst etwa 100.000 Tokens an interner Verarbeitung erfordern. Diese Informationen werden anschließend auf eine durchschnittliche Beschreibung von ungefähr 4.000 Tokens verdichtet.
Diese komprimierte Repräsentation bildet die Grundlage für die weitere Generierung.
H3-VAE
Für die Verarbeitung und Komprimierung visueller Daten verwendet MiniMax einen neu entwickelten sogenannten H3-VAE.
Der überarbeitete Video-Tokenizer soll Bild- und Videoinformationen effizienter komprimieren und gleichzeitig eine hohe Rekonstruktionsqualität ermöglichen. Laut MiniMax erreicht das Verfahren eine viermal größere effektive Sequenzlänge.
Vereinfacht ausgedrückt kann das Modell dadurch mehr visuelle Informationen innerhalb eines begrenzten Rechenbudgets verarbeiten. Diese Effizienz soll sowohl die Trainings- als auch die Generierungskosten senken und ist nach Angaben des Unternehmens eine wichtige Voraussetzung für die native 2K-Ausgabe.
H3-Omni Transformer
Der H3-Omni Transformer bildet die zentrale Modellarchitektur. MiniMax hat sich dabei bewusst gegen eine Weiterentwicklung der Architektur des Vorgängers Hailuo 02 entschieden.
Statt zusätzliche Spezialfunktionen in die bestehende Architektur einzubauen, wurde H3 stärker auf Generalisierung und Effizienz ausgerichtet. Das Modell soll möglichst flexibel auf unterschiedliche Eingabearten, Videolängen und Generierungsaufgaben reagieren können.
Da die Sequenzlängen bei multimodalen Eingaben stark variieren, trennt MiniMax bestimmte Rechenprozesse für Verständnis und Generierung. Die Hardwareauslastung kann dadurch für die jeweiligen Arbeitsschritte optimiert werden.
Laut Unternehmensangaben erhöhte diese Architektur den Trainingsdurchsatz um annähernd 30 Prozent. Dabei handelt es sich allerdings um eine Herstellerangabe, die bislang nicht durch einen vollständigen technischen Bericht unabhängig überprüft werden kann.
In-Context Regeneration
Für die 2K-Ausgabe verwendet H3 keinen klassischen, separat trainierten Super-Resolution-Prozess.
Stattdessen erzeugt das Basismodell zunächst ein niedriger aufgelöstes Ergebnis und generiert dieses anschließend erneut – diesmal unter Einbeziehung des ursprünglichen multimodalen Kontexts.
Diese In-Context Regeneration soll einen Vorteil gegenüber herkömmlicher Hochskalierung bieten. Ein klassischer Upscaler kennt häufig nur das bereits erzeugte Bild und muss fehlende Details nachträglich ergänzen. H3 kann dagegen erneut auf die ursprünglichen Texte, Bilder, Videos und Audiodaten zugreifen.
Dadurch sollen feine Elemente wie kleine Schriftzüge, Oberflächenstrukturen oder Markenmerkmale genauer rekonstruiert werden können.
Open Weights sollen folgen
MiniMax bezeichnet H3 als Open-Weights-Modell und kündigt an, die Modellgewichte unter Berücksichtigung geltender Gesetze und Vorschriften zugänglich zu machen.
Das könnte für Entwickler und Unternehmen besonders relevant sein. Offene Modellgewichte ermöglichen grundsätzlich mehr Kontrolle als ein ausschließlich über eine geschlossene Onlineplattform verfügbares System.
Entwickler könnten das Modell beispielsweise:
- auf eigener Hardware betreiben,
- für bestimmte Produktionsabläufe anpassen,
- in bestehende Software integrieren,
- für spezielle Bild- oder Videostile optimieren,
- oder auf neue Hardwareplattformen übertragen.
MiniMax erklärt, die Kompatibilität mit unterschiedlichen KI-Beschleunigern sei bereits während der Entwicklung berücksichtigt worden.
Allerdings sollte zwischen einer Ankündigung und einer tatsächlich veröffentlichten Open-Weights-Version unterschieden werden. Aus dem vorliegenden Beitrag gehen weder eine konkrete Lizenz noch die vollständigen Nutzungsbedingungen hervor. Entscheidend wird daher sein, unter welchen Bedingungen die Gewichte veröffentlicht werden und ob eine kommerzielle Nutzung, Weiterentwicklung und Weiterverteilung erlaubt ist.
Niedrigere Preise als etablierte Videomodelle
Neben der technischen Leistungsfähigkeit hebt MiniMax besonders das Preis-Leistungs-Verhältnis hervor.
Nach Angaben des Unternehmens kostet die Generierung pro Videosekunde bei 2K weniger als ein Drittel dessen, was vergleichbare etablierte Modelle verlangen. Eine Ausgabe mit 768p soll weniger als die Hälfte des Preises kosten, den andere Anbieter für 720p-Videos berechnen.
Diese Aussagen lassen sich anhand des veröffentlichten Beitrags jedoch nur eingeschränkt vergleichen. MiniMax nennt darin keine einheitliche Liste der verglichenen Modelle und berücksichtigt auch nicht, ob sich Qualität, Generierungsdauer, Tonumfang und Nutzungsrechte direkt gegenüberstellen lassen.
Für professionelle Anwender wird deshalb nicht allein der Preis pro Sekunde entscheidend sein. Ebenso wichtig sind die Zuverlässigkeit bei komplexen Anweisungen, die Konsistenz über mehrere Szenen, Wartezeiten, kommerzielle Rechte und die benötigte Rechenleistung beim lokalen Betrieb.
Noch kein vollständiger technischer Bericht
MiniMax kündigt einen ausführlichen technischen Bericht zu H3 an. Der bisher veröffentlichte Beitrag beschreibt zwar die grundlegende Architektur, enthält jedoch noch keine umfassenden Angaben zu Modellgröße, Trainingsdaten, benötigter Hardware oder standardisierten Benchmarks.
Auch bei der visuellen Qualität sieht MiniMax selbst noch Verbesserungspotenzial. Besonders feine Details sollen in bestimmten Situationen weiter optimiert werden. Für zukünftige Modellversionen plant das Unternehmen außerdem höhere Auflösungen und eine stärkere Integration der multimodalen Verständnisfähigkeiten aus der eigenen M-Modellreihe.
Damit bleibt offen, wie zuverlässig H3 außerhalb ausgewählter Demonstrationen arbeitet. Insbesondere bei längeren Videos, komplexen Dialogen, mehreren Figuren und konsistenter Objektbewegung dürften unabhängige Tests entscheidend sein.
Fazit
MiniMax H3 zeigt, wohin sich generative Videomodelle entwickeln könnten. Statt separate Werkzeuge für Bilder, Videos, Stimmen, Musik und Bearbeitung einzusetzen, soll ein einziges Modell unterschiedliche Medien gemeinsam verstehen und erzeugen.
Besonders interessant sind die native 2K-Ausgabe, die integrierte Stereo-Audiospur und die Möglichkeit, mehrere Referenzen in natürlicher Sprache miteinander zu verbinden. Auch die angekündigte Veröffentlichung der Modellgewichte könnte H3 von vielen geschlossenen Videoplattformen unterscheiden.
Noch stammen die meisten Leistungs- und Preisangaben allerdings direkt von MiniMax. Ein vollständiger technischer Bericht, unabhängige Qualitätsvergleiche und die konkreten Lizenzbedingungen stehen noch aus.
Sollte H3 die gezeigten Fähigkeiten auch im praktischen Einsatz zuverlässig erreichen, könnte das Modell dennoch einen wichtigen Schritt markieren: weg vom einfachen KI-Clipgenerator und hin zu einem multimodalen Produktionswerkzeug, das Bild, Ton, Video und Bearbeitung in einem gemeinsamen kreativen Prozess verbindet.
Quelle: MiniMax Research – MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities