Naar inhoud

UlazAI - AI Beeld & Video Tools

AI VIDEOBENCHMARK 2023 → 2026

Van Nachtmerriespaghetti aan Filmische AI-films

In slechts drie jaar tijd ging AI-video van het genereren van vreselijke horror naar het produceren van scènes van bioscoopkwaliteit met uitsnijdingen vanuit meerdere hoeken, realistische dialogen en gesynchroniseerde audio. Hier is het volledige verhaal.

Kling 3.0 — maart 2026

Gegenereerd met Kling 3.0 op UlazAI - meerdere scènes, AI-audio, Fresh Prince-geïnspireerd

De benchmark ‘Will Smith die spaghetti eet’

In maart 2023 ging een video gegenereerd door een vroeg AI-model om de verkeerde redenen viraal. De prompt was eenvoudig: 'Will Smith eet spaghetti.' Het resultaat was pure nachtmerriebrandstof: een verwrongen gezicht, smeltende handen, noedels die versmolten met vlees en bewegingen die eerder in een horrorfilm thuishoorden dan in een eetkamer.

Die video werd de onofficiële maatstaf voor het genereren van AI-video's. Om de paar maanden vernieuwden makers hetzelfde concept om de voortgang te meten. Wat begon als een meme werd een serieuze documentatie van een van de snelste technologische sprongen in de geschiedenis.

Snel vooruit naar maart 2026: hetzelfde concept – nu weergegeven door Kling 3.0 — produceert een filmische minifilm compleet met overgangen van meerdere scènes, gesynchroniseerde dialogen, achtergrondmuziek en een verhaal met Fresh Prince of Bel-Air-thema. De kloof tussen 2023 en 2026 is geen stapsgewijze verbetering, maar een generatierevolutie.

De evolutietijdlijn

Drie jaar vooruitgang, gemeten met één simpele prompt

2023

De donkere middeleeuwen

Eldritch-horrortijdperk

Vroege modellen zoals ModelScope en Runway Gen-1 konden nauwelijks een seconde lang de ruimtelijke samenhang behouden. Menselijke gezichten smolten, handen brachten extra vingers voort en objecten liepen door elkaar heen. De video 'Will Smith spaghetti' was een voorbeeld van alles wat verkeerd was: het gezicht was vervormd, noedels versmolten met de huid en de fysica bestond niet.

Geen gezichtsconsistentie Maximaal 2-4 seconden Resolutie van 256-512px Geen geluid Nachtmerrie natuurkunde
2024

Herkenbaar maar griezelig

Het Uncanny Valley-jaar

Modellen als Sora (preview), Runway Gen-2 en Pika begonnen herkenbare mensen en samenhangende scènes te produceren. De spaghetti-benchmark kon nu aantonen dat iemand daadwerkelijk at, maar er was altijd iets 'niet goed'. De bewegingen waren iets te soepel, de verlichting flikkerde tussen de frames en de handen worstelden nog steeds met keukengerei. Clips van vijf seconden werden standaard, maar als ze verder reikten, was er zichtbare verslechtering.

Basisconsistentie van het gezicht 5-10 seconden 720p resolutie Nog steeds griezelig Slechts één scène
2025

Indrukwekkend echt

Het doorbraakjaar

Veo 3, Kling 2.0 en Sora 2 leverden bijna fotorealistische resultaten. De Veo 3 van Google kan clips van 8 seconden genereren met native dialogen en geluidseffecten. Kling 2.6 introduceerde bewegingsbediening en audiovisuele synchronisatie. De spaghetti-benchmark zag er nu uit als een echte kookshow: individuele noedels zichtbaar, stoom die op natuurlijke wijze stijgt, vorkbewegingen fysiek nauwkeurig. De griezelige vallei werd doorkruist voor korte clips.

Bijna fotorealistisch 8-15 seconden 1080p native Inheemse audio Lipsynchronisatie
2026

Filmische AI-films

De filmische revolutie

Kling 3.0 kan produceren verhalen met meerdere scènes met camerafragmenten, opnamecompositie en scène-overgangen. In de bovenstaande demonstratie omvat de output een opname, close-ups, dialoog, achtergrondmuziek en een slotscène. Controleer zelf de continuïteit, het geluid en het tempo voordat u het resultaat gebruikt.

Uitsnijdingen met meerdere scènes Door AI gegenereerde dialoog 1080p filmisch Achtergrondmuziek Scène-overgangen Verhalende structuur

Wat Kling 3.0 toevoegt: video met meerdere scènes, dialoog en gesynchroniseerde audio

Deze mogelijkheden verplaatsen de workflow verder dan geïsoleerde stille clips.

🎬

Generatie van meerdere scènes

In tegenstelling tot modellen met één clip genereert de Kling 3.0 complete reeksen met meerdere camerahoeken, scènewisselingen en verhaallijnen – allemaal vanuit één enkele prompt.

🗣️

Door AI gegenereerde dialoog

Personages spreken met natuurlijke intonatie, goede lipsynchronisatie en contextueel passende dialogen. De audio wordt naast de video gegenereerd en niet erbovenop gelaagd.

🎵

Geïntegreerd audio-ontwerp

Achtergrondmuziek, omgevingsgeluiden en geluidseffecten worden allemaal synchroon met de visuele inhoud gegenereerd. Geen postproductie-audiowerk nodig.

🎥

Filmisch camerawerk

Intelligente opnamecompositie met basisopnamen, mediumopnamen en close-ups. De AI begrijpt de principes van cinematografie en past deze automatisch toe.

✂️

Slimme scèneovergangen

Natuurlijke overgangen tussen scènes die de montageconventies volgen: match-cuts, J-cuts en cross-dissolves op basis van de verhalende context.

👥

Karakterconsistentie

Personages behouden hun uiterlijk, kleding en maniertjes in alle scènes. Geen identiteitsverschuivingen meer tussen bezuinigingen.

AI-videomodellen door de jaren heen

Hoe de leidende modellen zich over de generaties heen opstapelen

Functie 2023-modellen 2024-modellen 2025-modellen Kling 3.0 (2026)
Maximale resolutie 256-512px 720p 1080p 1080p filmisch
Maximale duur 2-4 sec 5-10 sec 8-15 sec 10-20+ sec. meerdere scènes
Audio Geen Geen Inheemse dialoog Volledig audio-ontwerp
Scène-uitsneden Geen Geen Basis Verhaal met meerdere scènes
Gezichtskwaliteit Smelten/vervormd Herkenbaar Bijna fotorealistisch Fotorealistisch + expressief
Hand-/objectfysica Gebroken Verbeterd Goed Fysiek accuraat
Karakterconsistentie Geen Binnen één clip Goed binnen clip In alle scènes

Wat dit betekent voor makers

De verschuiving van het genereren van één clip naar verhalende productie met meerdere scènes is niet alleen een technische upgrade; het is een fundamenteel ander creatief hulpmiddel. In 2023 was AI-video een noviteit. In 2024 was het een curiosum. In 2025 werd het nuttig. In 2026 wordt het met modellen als Kling 3.0 een productieplatform.

Een tekstbeschrijving kan nu een korte video produceren met dialoog, muziek en meerdere shots. Productmarketeers kunnen demoscènes opstellen en docenten kunnen geïllustreerde uitleg creëren, maar het resultaat moet nog steeds worden beoordeeld, bewerkt en op rechten worden gecontroleerd voordat het wordt gepubliceerd.

De Will Smith-spaghettibenchmark begon als een grap. Drie jaar later is het een opvallende visualisatie van exponentiële vooruitgang. En we zijn nog maar net begonnen: met modellen die elk kwartaal verbeteren, wordt de kloof tussen door AI gegenereerde en traditioneel geproduceerde video steeds kleiner.