UlazAI - KI-Bild- & Video-Tools
Von Albtraum-Spaghetti zu Kinematische KI-Filme
In nur drei Jahren entwickelte sich KI-Video von der Erzeugung unheimlichen Horrors zu Szenen in Kinoqualität mit Schnitten aus mehreren Blickwinkeln, realistischen Dialogen und synchronisiertem Ton. Hier ist die ganze Geschichte.
Erstellt mit Kling 3.0 auf UlazAI – Multiszene, KI-Audio, von Fresh Prince inspiriert
Der Maßstab „Will Smith isst Spaghetti“.
Im März 2023 ging ein von einem frühen KI-Modell erstelltes Video aus den falschen Gründen viral. Der prompt war einfach: „Will Smith isst Spaghetti.“ Das Ergebnis war reiner Albtraumtreibstoff – ein verzerrtes Gesicht, schmelzende Hände, mit Fleisch verschmolzene Nudeln und Bewegungen, die eher in einen Horrorfilm als in ein Esszimmer gehörten.
Dieses Video wurde zum inoffiziellen Maßstab für die KI-Videogenerierung. Alle paar Monate überarbeiteten die Entwickler dasselbe Konzept, um den Fortschritt zu messen. Was als Meme begann, wurde zu einer ernsthaften Dokumentation eines der schnellsten Technologiesprünge der Geschichte.
Schneller Vorlauf bis März 2026: das gleiche Konzept – jetzt gerendert von Kling 3.0 – produziert einen filmischen Minifilm mit Mehrszenenübergängen, synchronisierten Dialogen, Hintergrundmusik und einer Erzählung zum Thema „Der Prinz von Bel-Air“. Die Lücke zwischen 2023 und 2026 ist keine schrittweise Verbesserung – es ist eine Generationsrevolution.
Die Evolutionszeitleiste
Drei Jahre Fortschritt, gemessen an einem einfachen prompt
Das dunkle Zeitalter
Eldritch-Horror-Ära
Frühe Modelle wie ModelScope und Runway Gen-1 konnten die räumliche Kohärenz kaum eine Sekunde lang aufrechterhalten. Menschliche Gesichter verschmolzen, aus Händen entstanden zusätzliche Finger und Gegenstände verschwanden ineinander. Das „Will Smith Spaghetti“-Video veranschaulichte alles Falsche: Das Gesicht war verzerrt, Nudeln verschmolzen mit der Haut und die Physik war nicht existent.
Erkennbar, aber unheimlich
Das Uncanny Valley-Jahr
Modelle wie Sora (Vorschau), Runway Gen-2 und Pika begannen, erkennbare Menschen und zusammenhängende Szenen zu produzieren. Der Spaghetti-Benchmark konnte nun zeigen, dass eine Person tatsächlich isst – aber irgendetwas stimmte immer nicht. Die Bewegungen waren etwas zu flüssig, das Licht flackerte zwischen den Bildern und die Hände kämpften immer noch mit Utensilien. Fünf-Sekunden-Clips wurden zum Standard, aber eine darüber hinausgehende Länge verursachte sichtbare Verschlechterungen.
Beeindruckend echt
Das Jahr des Durchbruchs
Veo 3, Kling 2.0 und Sora 2 lieferten nahezu fotorealistische Ergebnisse. Der Veo 3 von Google könnte 8-Sekunden-Clips mit nativen Dialogen und Soundeffekten erzeugen. Kling 2.6 führte Bewegungssteuerung und audiovisuelle Synchronisierung ein. Der Spaghetti-Benchmark sah jetzt aus wie eine echte Kochshow – einzelne Nudeln sichtbar, Dampf stieg auf natürliche Weise auf, Gabelbewegungen physikalisch präzise. Das unheimliche Tal wurde für kurze Clips durchquert.
Kinematische KI-Filme
Die filmische Revolution
Kling 3.0 produzieren kann Mehrszenen-Erzählungen mit Kameraschnitten, Bildkomposition und Szenenübergängen. In der obigen Demonstration umfasst die Ausgabe eine Einspielaufnahme, Nahaufnahmen, Dialoge, Hintergrundmusik und eine Schlussszene. Überprüfen Sie Kontinuität, Audio und Tempo, bevor Sie das Ergebnis verwenden.
Was Kling 3.0 hinzufügt: Mehrszenen-Video, Dialoge und synchronisiertes Audio
Diese Funktionen erweitern den Workflow über isolierte stille Clips hinaus.
Multi-Szenen-Generierung
Im Gegensatz zu Einzelclip-Modellen generiert Kling 3.0 komplette Sequenzen mit mehreren Kamerawinkeln, Szenenwechseln und Erzählfluss – alles aus einem einzigen prompt.
KI-generierter Dialog
Die Charaktere sprechen mit natürlicher Intonation, korrekter Lippensynchronisation und kontextbezogenen Dialogen. Der Ton wird neben dem Video generiert und nicht darüber geschichtet.
Integriertes Audiodesign
Hintergrundmusik, Umgebungsgeräusche und Soundeffekte werden alle synchron mit dem visuellen Inhalt generiert. Es ist keine Audio-Nachbearbeitung erforderlich.
Filmische Kameraarbeit
Intelligente Bildkomposition mit Einspiel-, Zwischen- und Nahaufnahmen. Die KI versteht die Prinzipien der Kinematographie und wendet sie automatisch an.
Intelligente Szenenübergänge
Natürliche Schnitte zwischen Szenen, die Schnittkonventionen folgen – passende Schnitte, J-Schnitte und Überblendungen basierend auf dem Erzählkontext.
Charakterkonsistenz
Die Charaktere behalten in allen Szenen ihr Aussehen, ihre Kleidung und ihre Verhaltensweisen bei. Keine Identitätsverschiebungen mehr zwischen den Schnitten.
KI-Videomodelle im Laufe der Jahre
Wie sich die führenden Modelle über Generationen hinweg schlagen
| Besonderheit | 2023 Modelle | 2024 Modelle | 2025 Modelle | Kling 3.0 (2026) |
|---|---|---|---|---|
| Maximale Auflösung | 256-512px | 720p | 1080p | 1080p filmisch |
| Maximale Dauer | 2-4 Sek | 5-10 Sek | 8-15 Sek | 10-20+ Sek. Multiszene |
| Audio | Keine | Keine | Nativer Dialog | Vollständiges Audiodesign |
| Szenenschnitte | Keine | Keine | Einfach | Mehrszenen-Erzählung |
| Gesichtsqualität | Schmelzend/verzerrt | Erkennbar | Nahezu fotorealistisch | Fotorealistisch + ausdrucksstark |
| Hand-/Objektphysik | Gebrochen | Verbessert | Gut | Physikalisch genau |
| Charakterkonsistenz | Keine | Innerhalb eines einzelnen Clips | Gut im Clip | Über alle Szenen hinweg |
Was das für Schöpfer bedeutet
Der Übergang von der Generierung einzelner Clips zur narrativen Produktion mit mehreren Szenen ist nicht nur ein technisches Upgrade, sondern ein grundlegend anderes kreatives Werkzeug. Im Jahr 2023 war KI-Video ein Novum. Im Jahr 2024 war es eine Kuriosität. Im Jahr 2025 wurde es nützlich. Im Jahr 2026 wird es mit Modellen wie Kling 3.0 zur Produktionsplattform.
Mit einer Textbeschreibung können jetzt Kurzvideos mit Dialogen, Musik und mehreren Aufnahmen erstellt werden. Produktvermarkter können Demoszenen entwerfen und Pädagogen illustrierte Erklärungen erstellen, aber das Ergebnis muss vor der Veröffentlichung noch überprüft, bearbeitet und auf Rechte überprüft werden.
Der Spaghetti-Benchmark von Will Smith begann als Witz. Drei Jahre später ist es eine eindrucksvolle Visualisierung des exponentiellen Fortschritts. Und wir fangen gerade erst an – da sich die Modelle vierteljährlich verbessern, wird die Kluft zwischen KI-generierten und traditionell produzierten Videos immer kleiner.
Führen Sie den Benchmark prompt selbst durch
Öffnen Sie Kling 3.0 oder ein anderes Videomodell in UlazAI, verwenden Sie den Benchmark prompt erneut und vergleichen Sie Bewegung, Kontinuität, Audio und Kosten.