Der Markt für KI-Videomodelle hat in diesem Sommer ein neues, offenes Schwergewicht bekommen. Am 11. August 2026 hat das israelische Unternehmen Lightricks – bekannt geworden mit Facetune und dem Kreativ-Stack LTX Studio – die Version LTX-2.5 seines Audio-und-Video-Modells veröffentlicht. Anders als die geschlossenen Systeme aus den USA und China setzt Lightricks konsequent auf offene Gewichte: Das Modell steht auf Hugging Face zum Download bereit, läuft über eine Tag-eins-Integration direkt in ComfyUI und lässt sich – das ist der entscheidende Punkt – auf der eigenen Hardware betreiben, ohne dass ein einziges Frame das eigene Studio verlässt.

Für eine KI-Videoproduktion wie uns ist das keine Randnotiz. Es verschiebt die Frage weg von „Welchen Cloud-Anbieter buchen wir?" hin zu „Was können wir selbst hosten, kontrollieren und ohne laufende Kosten pro Clip einsetzen?". Wir haben uns die Ankündigung, die Spezifikationen und die Fallstricke genauer angesehen.

Was Lightricks mit LTX-2.5 verändert hat

LTX-2.5 ist ein Diffusion-Transformer mit rund 22 Milliarden Parametern, der Bild und Ton in einem einzigen Durchlauf erzeugt. Das Modell nimmt Text-, Bild- oder Video-Prompts entgegen und liefert Clips mit nativer, lippen- und szenensynchroner Tonspur – also Dialog, Soundeffekte und Musik direkt aus demselben Modell, statt Audio in einem zweiten Arbeitsschritt nachträglich zu montieren. Gegenüber der vorangegangenen LTX-2-Generation, die Lightricks zuvor als erstes produktionsreifes offenes Audio-plus-Video-Modell positioniert hatte, nennt das Unternehmen vor allem zwei Neuerungen: einen überarbeiteten „Diffusion Video Decoder" für schärfere Gesichter und lesbaren Text im Bild sowie eine native Mehr-Shot-Erzeugung, die Figuren und Bildstil über mehrere aufeinanderfolgende Einstellungen hinweg konsistent hält.

Gerade der zweite Punkt ist für erzählerische Formate relevant. Wer bisher mit KI-Modellen längere Sequenzen bauen wollte, kämpfte regelmäßig mit „Character Drift" – das Gesicht, die Kleidung oder der Look kippten von Shot zu Shot. Ein Modell, das Mehr-Shot-Konsistenz nativ mitbringt, spart genau die aufwendige Nacharbeit, die kurze KI-Clips bislang so teuer in der Postproduktion machte.

Die harten Fakten im Überblick

  • Veröffentlichung: 11. August 2026, Entwickler Lightricks (LTX)
  • Architektur: Diffusion-Transformer, ca. 22 Milliarden Parameter
  • Ausgabe: Video mit nativer, synchroner Audiospur in einem Durchgang
  • Auflösung: 720p als Basis, bis zu 4K über die „Fast"-Endpunkte
  • Länge: Clips bis rund 20 Sekunden
  • Verfügbarkeit: offene Gewichte auf Hugging Face, ComfyUI-Integration ab Tag eins, gemanagte API sowie Zugang über Partnerplattformen
  • Lokaler Betrieb: lauffähig auf GPUs ab 16 GB VRAM
  • Lizenz: kostenlos für Organisationen mit unter 10 Mio. US-Dollar Jahresumsatz, darüber kommerzielle Lizenz nötig
Serverschränke in einem Rechenzentrum
Foto: Brett Sayles via Pexels (Pexels License)

Offen, aber mit Bedingungen: Lizenz und Verfügbarkeit

„Offen" heißt bei LTX-2.5 nicht bedingungslos. Lightricks stellt die Modellgewichte frei zum Download – wer will, kann sie herunterladen, lokal ausführen und in eigene Pipelines einbauen. Kommerziell nutzen dürfen das Modell nach Unternehmensangaben alle Organisationen mit weniger als zehn Millionen US-Dollar Jahresumsatz gratis; erst oberhalb dieser Schwelle wird eine gesonderte kommerzielle Lizenz fällig. Für den lokalen Einsatz fallen dabei weder Gebühren pro Clip noch aufgezwungene Wasserzeichen an – ein deutlicher Unterschied zu vielen Cloud-Diensten.

Verteilt wird LTX-2.5 über mehrere Kanäle gleichzeitig: die offenen Gewichte auf Hugging Face, eine native ComfyUI-Anbindung zum Start, eine gemanagte API für alle, die sich nicht um Infrastruktur kümmern wollen, sowie den Zugang über etablierte Kreativplattformen. Lightricks selbst verweist darauf, dass die LTX-Modellfamilie inzwischen mehr als 33 Millionen Downloads erreicht habe – nach eigener Darstellung die meistgenutzte offene „World-Model"-Reihe am Markt.

Die eigentliche Neuigkeit ist nicht ein weiterer Prozentpunkt Bildqualität, sondern die Kontrolle: Wer LTX-2.5 lokal betreibt, generiert Video, ohne Rohmaterial, Prompts oder Kundendaten an einen fremden Cloud-Endpunkt zu schicken.

Geschwindigkeit: die 6,8 Sekunden richtig einordnen

Die Zahl, die durch alle Meldungen geistert, lautet: zehn Sekunden Video in 6,8 Sekunden. Sie stimmt – aber sie braucht Kontext. Der Wert wurde von Lightricks selbst gemessen, und zwar für einen 10-Sekunden-Clip in 720p auf zwei NVIDIA-GB200-Superchips im Dauerbetrieb. Das sind Rechenzentrums-Beschleuniger der obersten Kategorie, nicht die Grafikkarte im heimischen Schnittplatz.

Realistisch heißt das: Wer LTX-2.5 auf einer Consumer- oder Prosumer-GPU ab 16 GB VRAM lokal laufen lässt, sollte die 6,8 Sekunden als Bestwert unter Ideal­bedingungen verstehen, nicht als das, was der eigene Rechner liefert. Trotzdem bleibt die Botschaft stark: Ein offenes Modell, das synchrones Bild und Audio erzeugt und dabei auf verfügbarer Hardware überhaupt sinnvoll läuft, senkt die Einstiegshürde für kleine Teams erheblich. Die Frage ist nicht mehr, ob man es lokal betreiben kann, sondern nur noch, wie schnell.

Einordnung: Wo LTX-2.5 im Markt steht

Der Zeitpunkt ist bemerkenswert. Der Videomarkt ist 2026 in Bewegung wie nie: OpenAIs Sora-2-API läuft aus, während chinesische Anbieter mit ByteDances Seedance 2.5, MiniMax H3/Hailuo 3.0, Alibabas Wan 3.0 und Kuaishous Kling in immer kürzeren Abständen nachlegen. Google hält mit der Veo-Reihe dagegen, Black Forest Labs hat mit Flux 3 Video ein weiteres Modell mit nativem Ton in den Ring geworfen. In diesem Feld besetzt LTX-2.5 eine eigene, klar abgegrenzte Nische: Es ist nicht das Modell mit der spektakulärsten Marketing-Demo, sondern das mit der offensten Lizenz und dem konsequentesten Fokus auf lokalen Betrieb.

Man kann die Achse so ziehen: Auf der einen Seite stehen geschlossene Premium-Systeme, die über eine API laufen, pro Sekunde abgerechnet werden und die höchste Politur bieten. Auf der anderen Seite stehen offene Gewichte, die man selbst hostet, ohne Nutzungsgebühr pro Clip und mit voller Datenkontrolle – dafür mit mehr Eigenaufwand bei Einrichtung und Betrieb. LTX-2.5 ist das derzeit ausgereifteste Angebot auf dieser zweiten Seite, und es kombiniert den offenen Ansatz mit einer gemanagten API für alle, die den Bequemlichkeitsweg vorziehen.

Videoschnittplatz mit zwei Monitoren im Studio
Foto: Ron Lach via Pexels (Pexels License)

Was das für eure Projekte bedeutet

Für Auftraggeber und Kreative, die mit uns arbeiten, ergeben sich aus LTX-2.5 drei konkrete Punkte. Erstens: Datenschutz und Vertraulichkeit. Wenn ein Projekt sensibles Material enthält – unveröffentlichte Produkte, interne Kampagnen, Personen, deren Aufnahmen nicht in fremde Clouds sollen – ist ein lokal betriebenes, offenes Modell ein echtes Argument. Das Rohmaterial bleibt im Haus, es gibt keinen Upload an einen Drittanbieter, und die Verarbeitung lässt sich sauber dokumentieren. Gerade im europäischen Umfeld, in dem seit dem 2. August 2026 zusätzlich die Kennzeichnungspflichten des EU AI Act greifen, ist diese Nachvollziehbarkeit ein Wert an sich.

Zweitens: Kostenstruktur. Bei Cloud-Modellen zahlt man pro Sekunde generiertem Video – bei ausgiebigem Ausprobieren, Varianten und Testläufen summiert sich das schnell. Ein lokal laufendes Modell ohne Gebühr pro Clip verschiebt die Kosten auf die einmalige Hardware und den Strom. Für Studios, die viel iterieren – zwanzig Varianten eines 15-Sekünders, bis Timing und Look sitzen – kann das den Unterschied zwischen kalkulierbar und teuer ausmachen. Die naheliegende Arbeitsteilung: LTX-2.5 lokal für die vielen Test- und Volumenläufe, ein geschlossenes Premium-Modell für den finalen Hero-Shot, wo es auf jede Nuance ankommt.

Drittens: Konsistenz über mehrere Shots. Die native Mehr-Shot-Funktion ist genau die Fähigkeit, die man für kurze Markenspots, Erklärvideos oder Social-Formate mit wiederkehrenden Figuren braucht. Wenn ein Charakter über drei Einstellungen hinweg gleich aussieht, entfällt ein Großteil der bisher üblichen Reparaturarbeit. Das heißt nicht, dass die Postproduktion verschwindet – aber sie verschiebt sich von „Fehler ausbügeln" zu „gezielt gestalten".

Wichtig bleibt die ehrliche Erwartungshaltung: LTX-2.5 ist kein Knopf, der fertige Werbefilme ausspuckt. Es ist ein leistungsfähiges Werkzeug, das Einrichtung, Prompting-Know-how und eine durchdachte Pipeline verlangt – und genau dort liegt der Mehrwert einer Produktion, die das Modell professionell einsetzt, statt es nur auszuprobieren.

Fazit

LTX-2.5 ist kein lautes Release, aber ein strategisch wichtiges. Während sich die Schlagzeilen um immer neue geschlossene Modelle drehen, baut Lightricks konsequent an einer offenen Alternative, die man besitzen statt mieten kann. Für kleine und mittlere Studios – für die 10-Millionen-Dollar-Grenze also für die allermeisten – ist das ein Angebot, das Kontrolle, Datenschutz und planbare Kosten zusammenbringt. Wir werden das Modell in den kommenden Wochen im eigenen Workflow testen und berichten, wie es sich abseits der Hersteller-Benchmarks im echten Produktionsalltag schlägt.