Zum Inhalt springen

UlazAI - KI-Bild- & Video-Tools

KI-VIDEO-BENCHMARK 2023 → 2026

Von Albtraum-Spaghetti zu Kinematische KI-Filme

In nur drei Jahren entwickelte sich KI-Video von der Erzeugung unheimlichen Horrors zu Szenen in Kinoqualität mit Schnitten aus mehreren Blickwinkeln, realistischen Dialogen und synchronisiertem Ton. Hier ist die ganze Geschichte.

Kling 3.0 – März 2026

Erstellt mit Kling 3.0 auf UlazAI – Multiszene, KI-Audio, von Fresh Prince inspiriert

Der Maßstab „Will Smith isst Spaghetti“.

Im März 2023 ging ein von einem frühen KI-Modell erstelltes Video aus den falschen Gründen viral. Der prompt war einfach: „Will Smith isst Spaghetti.“ Das Ergebnis war reiner Albtraumtreibstoff – ein verzerrtes Gesicht, schmelzende Hände, mit Fleisch verschmolzene Nudeln und Bewegungen, die eher in einen Horrorfilm als in ein Esszimmer gehörten.

Dieses Video wurde zum inoffiziellen Maßstab für die KI-Videogenerierung. Alle paar Monate überarbeiteten die Entwickler dasselbe Konzept, um den Fortschritt zu messen. Was als Meme begann, wurde zu einer ernsthaften Dokumentation eines der schnellsten Technologiesprünge der Geschichte.

Schneller Vorlauf bis März 2026: das gleiche Konzept – jetzt gerendert von Kling 3.0 – produziert einen filmischen Minifilm mit Mehrszenenübergängen, synchronisierten Dialogen, Hintergrundmusik und einer Erzählung zum Thema „Der Prinz von Bel-Air“. Die Lücke zwischen 2023 und 2026 ist keine schrittweise Verbesserung – es ist eine Generationsrevolution.

Die Evolutionszeitleiste

Drei Jahre Fortschritt, gemessen an einem einfachen prompt

2023

Das dunkle Zeitalter

Eldritch-Horror-Ära

Frühe Modelle wie ModelScope und Runway Gen-1 konnten die räumliche Kohärenz kaum eine Sekunde lang aufrechterhalten. Menschliche Gesichter verschmolzen, aus Händen entstanden zusätzliche Finger und Gegenstände verschwanden ineinander. Das „Will Smith Spaghetti“-Video veranschaulichte alles Falsche: Das Gesicht war verzerrt, Nudeln verschmolzen mit der Haut und die Physik war nicht existent.

Keine Gesichtskonsistenz Maximal 2–4 Sekunden Auflösung 256–512 Pixel Kein Ton Albtraumphysik
2024

Erkennbar, aber unheimlich

Das Uncanny Valley-Jahr

Modelle wie Sora (Vorschau), Runway Gen-2 und Pika begannen, erkennbare Menschen und zusammenhängende Szenen zu produzieren. Der Spaghetti-Benchmark konnte nun zeigen, dass eine Person tatsächlich isst – aber irgendetwas stimmte immer nicht. Die Bewegungen waren etwas zu flüssig, das Licht flackerte zwischen den Bildern und die Hände kämpften immer noch mit Utensilien. Fünf-Sekunden-Clips wurden zum Standard, aber eine darüber hinausgehende Länge verursachte sichtbare Verschlechterungen.

Grundlegende Gesichtskonsistenz 5-10 Sekunden 720p-Auflösung Immer noch unheimlich Nur einzelne Szene
2025

Beeindruckend echt

Das Jahr des Durchbruchs

Veo 3, Kling 2.0 und Sora 2 lieferten nahezu fotorealistische Ergebnisse. Der Veo 3 von Google könnte 8-Sekunden-Clips mit nativen Dialogen und Soundeffekten erzeugen. Kling 2.6 führte Bewegungssteuerung und audiovisuelle Synchronisierung ein. Der Spaghetti-Benchmark sah jetzt aus wie eine echte Kochshow – einzelne Nudeln sichtbar, Dampf stieg auf natürliche Weise auf, Gabelbewegungen physikalisch präzise. Das unheimliche Tal wurde für kurze Clips durchquert.

Nahezu fotorealistisch 8-15 Sekunden 1080p nativ Natives Audio Lippensynchronisation
2026

Kinematische KI-Filme

Die filmische Revolution

Kling 3.0 produzieren kann Mehrszenen-Erzählungen mit Kameraschnitten, Bildkomposition und Szenenübergängen. In der obigen Demonstration umfasst die Ausgabe eine Einspielaufnahme, Nahaufnahmen, Dialoge, Hintergrundmusik und eine Schlussszene. Überprüfen Sie Kontinuität, Audio und Tempo, bevor Sie das Ergebnis verwenden.

Mehrszenenschnitte KI-generierter Dialog 1080p-Kinofilm Hintergrundmusik Szenenübergänge Erzählstruktur

Was Kling 3.0 hinzufügt: Mehrszenen-Video, Dialoge und synchronisiertes Audio

Diese Funktionen erweitern den Workflow über isolierte stille Clips hinaus.

🎬

Multi-Szenen-Generierung

Im Gegensatz zu Einzelclip-Modellen generiert Kling 3.0 komplette Sequenzen mit mehreren Kamerawinkeln, Szenenwechseln und Erzählfluss – alles aus einem einzigen prompt.

🗣️

KI-generierter Dialog

Die Charaktere sprechen mit natürlicher Intonation, korrekter Lippensynchronisation und kontextbezogenen Dialogen. Der Ton wird neben dem Video generiert und nicht darüber geschichtet.

🎵

Integriertes Audiodesign

Hintergrundmusik, Umgebungsgeräusche und Soundeffekte werden alle synchron mit dem visuellen Inhalt generiert. Es ist keine Audio-Nachbearbeitung erforderlich.

🎥

Filmische Kameraarbeit

Intelligente Bildkomposition mit Einspiel-, Zwischen- und Nahaufnahmen. Die KI versteht die Prinzipien der Kinematographie und wendet sie automatisch an.

✂️

Intelligente Szenenübergänge

Natürliche Schnitte zwischen Szenen, die Schnittkonventionen folgen – passende Schnitte, J-Schnitte und Überblendungen basierend auf dem Erzählkontext.

👥

Charakterkonsistenz

Die Charaktere behalten in allen Szenen ihr Aussehen, ihre Kleidung und ihre Verhaltensweisen bei. Keine Identitätsverschiebungen mehr zwischen den Schnitten.

KI-Videomodelle im Laufe der Jahre

Wie sich die führenden Modelle über Generationen hinweg schlagen

Besonderheit 2023 Modelle 2024 Modelle 2025 Modelle Kling 3.0 (2026)
Maximale Auflösung 256-512px 720p 1080p 1080p filmisch
Maximale Dauer 2-4 Sek 5-10 Sek 8-15 Sek 10-20+ Sek. Multiszene
Audio Keine Keine Nativer Dialog Vollständiges Audiodesign
Szenenschnitte Keine Keine Einfach Mehrszenen-Erzählung
Gesichtsqualität Schmelzend/verzerrt Erkennbar Nahezu fotorealistisch Fotorealistisch + ausdrucksstark
Hand-/Objektphysik Gebrochen Verbessert Gut Physikalisch genau
Charakterkonsistenz Keine Innerhalb eines einzelnen Clips Gut im Clip Über alle Szenen hinweg

Was das für Schöpfer bedeutet

Der Übergang von der Generierung einzelner Clips zur narrativen Produktion mit mehreren Szenen ist nicht nur ein technisches Upgrade, sondern ein grundlegend anderes kreatives Werkzeug. Im Jahr 2023 war KI-Video ein Novum. Im Jahr 2024 war es eine Kuriosität. Im Jahr 2025 wurde es nützlich. Im Jahr 2026 wird es mit Modellen wie Kling 3.0 zur Produktionsplattform.

Mit einer Textbeschreibung können jetzt Kurzvideos mit Dialogen, Musik und mehreren Aufnahmen erstellt werden. Produktvermarkter können Demoszenen entwerfen und Pädagogen illustrierte Erklärungen erstellen, aber das Ergebnis muss vor der Veröffentlichung noch überprüft, bearbeitet und auf Rechte überprüft werden.

Der Spaghetti-Benchmark von Will Smith begann als Witz. Drei Jahre später ist es eine eindrucksvolle Visualisierung des exponentiellen Fortschritts. Und wir fangen gerade erst an – da sich die Modelle vierteljährlich verbessern, wird die Kluft zwischen KI-generierten und traditionell produzierten Videos immer kleiner.

Führen Sie den Benchmark prompt selbst durch

Öffnen Sie Kling 3.0 oder ein anderes Videomodell in UlazAI, verwenden Sie den Benchmark prompt erneut und vergleichen Sie Bewegung, Kontinuität, Audio und Kosten.