Wilt u een advertentievrije ervaring? Upgrade uw abonnement.
Van Gogh Studio
Technische handleiding
Tekst-naar-video L0-modellen uitgelegd: een diepgaande analyse van meer dan 5000 woorden (2026)
25 februari 2026Leestijd: 45 minuten
Inleiding: Voorbij de goochelshow
We leven in een tijdperk van digitale wonderen. Met een paar toetsaanslagen kunnen we uitgestrekte buitenaardse landschappen tevoorschijn toveren, historische figuren tot leven wekken en filmscènes regisseren die ooit een Hollywoodbudget vereisten. Videogeneratoren zoals AI zijn onze moderne toverstokken geworden. Maar voor de echt nieuwsgierige maker, de kritische ontwikkelaar en de vooruitstrevende strateeg is de magie op zich niet genoeg. We moeten ons afvragen: Hoe werkt de truc?
Wat schuilt er achter het simpele tekstvak en de knop "Genereren"? Wat zijn de fundamentele architectonische blauwdrukken die een machine in staat stellen om te dromen in bewegende beelden? Dit begrijpen is niet zomaar een academische oefening. Het is de sleutel tot het ontsluiten van diepere creatieve controle, het anticiperen op de toekomst van de industrie en het nemen van weloverwogen beslissingen over de tools waarin u uw tijd en geld investeert.
Begin direct met 21 gratis credits.
Probeer meerdere AI modellen met 21 gratis maandelijkse credits – geen creditcard nodig.
Dit is geen productrecensie of een ranglijst. Dit is een expeditie naar het hart van de machine. Welkom bij onze uitgebreide gids van meer dan 5000 woorden over de technologie achter tekst-naar-video L5-modellen. We nemen je mee van de basisconcepten naar het meest recente onderzoek, waarbij we het complexe jargon ontcijferen en de elegante ideeën onthullen die deze revolutie mogelijk maken.
Bereid je voor op:
Hoofdstuk 1: De kwantumsprong - Waarom diffusiemodellen de overwinning behaalden: Een blik op het kernconcept dat ten grondslag ligt aan alle moderne generatieve L5-modellen en waarom het oudere methoden overtrof.
Hoofdstuk 2: De Transformer-revolutie, opnieuw vormgegeven voor video (DiT): Een diepgaande analyse van de Diffusion Transformer, de architectonische doorbraak die modellen zoals L2 mogelijk maakt.
Hoofdstuk 3: De kunst van compressie - De VAE begrijpen: Een onderzoek naar de cruciale rol van de Variational Autoencoder (VAE) bij het computationeel haalbaar maken van videogeneratie.
Hoofdstuk 4: Opschalen naar oneindigheid - Het genie van de mix van experts (MoE): Een uitleg van de slimme techniek waarmee modellen tot immense afmetingen kunnen groeien zonder een evenredige toename van de kosten.
Hoofdstuk 5: De symfonie van architecturen: Een holistisch overzicht van hoe deze componenten samenkomen en hoe hun verschillende arrangementen leiden tot de unieke sterke punten van modellen zoals Sora, Kling en Wan 2.2.
Dit is uw masterclass in de architectuur van AI videogeneratie. Laten we de black box openen.
Hoofdstuk 1: De kwantumsprong - Waarom diffusiemodellen wonnen
Om te begrijpen waar we nu staan, moeten we eerst begrijpen waar we vandaan komen. Jarenlang was het dominante paradigma in generatieve AI het Generative Adversarial Network (GAN). Een GAN bestaat uit twee neurale netwerken – een Generator en een Discriminator – die verwikkeld zijn in een voortdurend kat-en-muisspel. De Generator creëert nepbeelden en de Discriminator probeert deze te onderscheiden van echte beelden. Na verloop van tijd wordt de Generator zo goed in het misleiden van de Discriminator dat zijn creaties niet meer van de werkelijkheid te onderscheiden zijn.
GAN's waren revolutionair voor beeldgeneratie, maar ze hadden consequent moeite met video. Het kernprobleem was temporele instabiliteit. Hoewel een GAN een realistisch frame kon produceren, had het enorme moeite om ervoor te zorgen dat het volgende frame een logisch en coherent vervolg was op het eerste. Dit resulteerde vaak in flikkering, vervormingsartefacten en een volledig gebrek aan objectpermanentie.
Hier komt het Diffusiemodel in beeld. In plaats van te proberen een perfecte video in één stap te genereren, hanteren diffusiemodellen een radicaal andere, meer methodische aanpak, geïnspireerd door de thermodynamica.
Het diffusieproces uitgelegd:
Het voorwaartse proces (ruis toevoegen): Stel je voor dat je een perfecte, heldere videoclip hebt. Het voorwaartse proces voegt systematisch, stap voor stap, een kleine hoeveelheid willekeurige ruis toe aan deze clip, totdat er niets anders overblijft dan pure, onherkenbare ruis. Dit is het makkelijke deel.
Het omgekeerde proces (leren ruis verwijderen): Hier gebeurt de magie. Het L5-model wordt getraind op een simpele, maar diepgaande taak: bekijk bij elke stap de ruisige video en voorspel de exacte ruis die eraan is toegevoegd. Het model probeert niet de uiteindelijke, schone video te voorspellen. Het probeert alleen de ruis te voorspellen.
Generatie (de magische truc): Zodra het model is getraind, is generatie het omgekeerde proces in actie. Je begint met een canvas van pure willekeurige ruis. Je voert dit in het model en zegt: "Gebaseerd op de tekstprompt 'een kat die op een skateboard rijdt', welke ruis denk je dat er in deze ruis aanwezig is?" Het model voorspelt de ruis, en je trekt een kleine hoeveelheid van die voorspelde ruis van het beeld af. Je herhaalt dit proces honderden keren. Bij elke stap wordt het beeld iets minder ruisig en iets beter afgestemd op de prompt, totdat er een heldere, coherente video uit de ruis tevoorschijn komt, alsof het een foto is die zich ontwikkelt.
Dit stapsgewijze ruisonderdrukkingsproces bleek veel stabieler en krachtiger voor videogeneratie dan de alles-of-niets-aanpak van GAN's, en vormde de stabiele basis waarop de huidige revolutie is gebouwd.
Hoofdstuk 2: De Transformer-revolutie, opnieuw vormgegeven voor video (DiT)
In de eerste jaren van het diffusietijdperk was de meest gebruikte architectuur voor het ruisonderdrukkingsmodel een U-Net. Een U-Net is een type Convolutioneel Neuraal Netwerk (CNN) dat uitstekend geschikt is voor beeld-naar-beeld-taken. In 2022 introduceerde een artikel getiteld "Scalable Diffusion Models with Transformers" echter een baanbrekend idee: wat als we het U-Net zouden vervangen door een Transformer? Dit leidde tot de Diffusion Transformer (DiT), de architectuur die nu de basis vormt voor OpenAI's Sora en vele andere state-of-the-art modellen [1].
2.1 Waarom Transformers een natuurlijke keuze zijn
Transformers zijn oorspronkelijk ontworpen voor natuurlijke taalverwerking (NLP). Hun superkracht is het begrijpen van de relaties tussen elementen in een reeks (zoals woorden in een zin). Een DiT past dezelfde logica toe op visuele data.
In plaats van een afbeelding als één geheel te verwerken, splitst een DiT deze eerst op in een reeks kleinere fragmenten, of "tokens". Vervolgens behandelt het deze fragmenten net als woorden in een zin. Hierdoor leert het model niet alleen wat er in elk fragment zit, maar ook de complexe relaties tussen alle fragmenten. Voor video is dit zelfs nog krachtiger, omdat het model een reeks videoframes kan verwerken als een lange zin van ruimtetijdfragmenten, waarbij de relaties tussen objecten zowel in de ruimte als in de tijd worden geleerd [2].
2.2 De dood van inductieve bias
Het belangrijkste voordeel van de Transformer ten opzichte van de U-Net is het ontbreken van "inductieve bias". Een U-Net, als CNN, gaat er van uit dat lokale pixels meer met elkaar verbonden zijn dan pixels die verder weg liggen. Dit is een nuttige aanname, maar het is ook een beperking.
Een Transformer heeft geen dergelijke bias. Het gaat nergens van uit en leert alle relaties vanaf nul. Dit maakt het een schaalbaardere en flexibelere architectuur. Naarmate je er meer data aan toevoegt en de grootte vergroot, blijven de prestaties verbeteren, schijnbaar zonder limiet. Deze schaalbaarheid is de reden waarom DiT-gebaseerde modellen zoals Sora zo'n dramatische sprong voorwaarts in kwaliteit hebben kunnen maken.
Hoofdstuk 3: De kunst van compressie - De VAE begrijpen
Het uitvoeren van een diffusiemodel op onbewerkte videobeelden met hoge resolutie zou computationeel onmogelijk zijn, zelfs voor een supercomputer. Een paar seconden 1080p-video is een enorme hoeveelheid data. Om dit haalbaar te maken, werken modellen niet in de pixelruimte, maar in een gecomprimeerde latente ruimte.
Het hulpmiddel dat verantwoordelijk is voor deze compressie is de Variational Autoencoder (VAE).
Een VAE bestaat uit twee delen:
De Encoder: Dit netwerk neemt een videobeeld met volledige resolutie en comprimeert het tot een veel kleinere, dichtere representatie, een zogenaamde latente vector. Deze vector legt de essentiële informatie van het beeld vast in een zeer efficiënt formaat.
De Decoder: Dit netwerk neemt een latente vector en reconstrueert deze terug naar een beeld met volledige resolutie.
Het gehele diffusieproces – het toevoegen en aftrekken van ruis – vindt plaats in deze gecomprimeerde latente ruimte. Het DiT-model ziet nooit de daadwerkelijke pixels; het ziet alleen de latente vectoren. Pas helemaal aan het einde van het generatieproces wordt de uiteindelijke, ruisvrije latente vector nog een laatste keer door de decoder van de VAE geleid om de video te produceren die u ziet.
Voor video worden gespecialiseerde spatio-temporele VAE's gebruikt. Deze zijn ontworpen om niet alleen de ruimtelijke informatie (het beeld zelf) te comprimeren, maar ook de temporele informatie (hoe het beeld in de loop van de tijd verandert), waardoor de gecomprimeerde representatie geoptimaliseerd is voor het creëren van vloeiende, coherente beweging [3].
Hoofdstuk 4: Schalen naar oneindigheid - Het genie van Mixture of Experts (MoE)
Naarmate onderzoekers streefden naar een hogere kwaliteit, ontdekten ze dat het simpelweg groter maken van modellen (het toevoegen van meer parameters) betere resultaten opleverde. Dit creëerde echter een nieuw probleem. Een enkel, enorm model is ongelooflijk duur om uit te voeren, omdat voor elke afzonderlijke invoer het hele model geactiveerd moet worden.
Maak kennis met de Mixture of Experts (MoE), een slimme en steeds populairdere techniek voor het efficiënt schalen van modellen [4].
In plaats van één monolithisch model te creëren, maakt een MoE-architectuur een verzameling van kleinere, gespecialiseerde submodellen, de zogenaamde "experts". Het traint ook een klein "gating network" of "router".
Hoe MoE werkt:
Wanneer een input (een ruisende, latente patch) binnenkomt, wordt deze eerst naar het gating network gestuurd.
De taak van het gating network is om te bepalen welke van de vele experts het meest geschikt is om deze specifieke input te verwerken.
De input wordt vervolgens alleen naar de geselecteerde experts gestuurd. Alle andere experts blijven inactief, wat een enorme hoeveelheid rekenkracht bespaart.
Stel je het voor als een groot bedrijf. In plaats van dat elke medewerker elke vergadering bijwoont, heb je een manager (het gating network) die elke taak alleen naar de relevante afdeling (de experts) stuurt. Dit stelt het bedrijf (het model) in staat om een enorm totaal aantal medewerkers (parameters) te hebben, terwijl de kosten van elke afzonderlijke taak (inferentie) relatief laag blijven.
Modellen zoals Alibaba's Wan 2.2 en Google's Gemini-familie gebruiken MoE om enorme schaal te bereiken. Wan 2.2 gebruikt bijvoorbeeld een Mixture-of-Experts-aanpak, waarbij sommige experts zich specialiseren in het genereren van de algehele lay-out van een scène, terwijl anderen zich specialiseren in het verfijnen van fijne details, wat leidt tot zowel een hogere kwaliteit als een grotere efficiëntie [5].
Hoofdstuk 5: De Symfonie van Architecturen
Laten we het nu allemaal samenvoegen. Een modern, state-of-the-art tekst-naar-video-model is geen enkele entiteit, maar een symfonie van deze componenten die samenwerken.
Een typische generatiestroom:
Promptcodering: Uw tekstprompt wordt ingevoerd in een groot taalmodel (zoals een versie van GPT of T5) om te worden omgezet in een rijke numerieke representatie die het videomodel kan begrijpen.
Voorbereiding van de latente ruimte: Het systeem genereert een willekeurige ruistensor in de latente ruimte. Dit is het blanco canvas.
De ruisonderdrukkingslus (de kern van de generatie):
a. De huidige ruisende latente ruimte, samen met de gecodeerde tekstprompt, wordt ingevoerd in de Diffusietransformator (DiT).
b. Als het een MoE-model betreft, stuurt het gatingnetwerk delen van de data door naar specifieke experts binnen de DiT.
c. De DiT voorspelt de aanwezige ruis in de latente ruimte.
d. Deze voorspelde ruis wordt van de latente ruimte afgetrokken, waardoor deze iets schoner wordt.
e. Deze lus wordt een vast aantal keren herhaald (bijv. 50-200 keer).
Einddecodering: De uiteindelijke, schone latente vector wordt door de decoder van de Spatio-Temporele VAE geleid.
Uitvoer: De decoder van de VAE reconstrueert de latente vector tot de uiteindelijke videoframes met volledige resolutie die u ziet.
Deze elegante, meerstaps pipeline maakt het mogelijk dat deze modellen hun ongelooflijke resultaten behalen. De VAE zorgt voor efficiëntie, het diffusieproces voor stabiliteit en de Transformer-architectuur voor schaalbaarheid en kracht.
Architectonische verschillen en hun impact
De unieke kenmerken van modellen zoals Sora, Kling en Veo komen voort uit de manier waarop ze deze componenten implementeren en prioriteren.
De kracht van Sora in wereldsimulatie komt waarschijnlijk voort uit een extreem grote en goed getrainde Diffusion Transformer, waardoor het complexe ruimtetijdrelaties kan leren.
De cinematische kwaliteit en efficiëntie van Wan 2.2 zijn een direct gevolg van het baanbrekende gebruik van een Mixture-of-Experts-architectuur in de open-sourcewereld.
De visuele verfijning van Veo komt mogelijk voort uit een bijzonder hoogwaardige VAE en uitgebreide finetuning van esthetisch aantrekkelijke filmische data.
Conclusie: Van magie naar methode
Wat ooit magie was, is nu hopelijk methode. Het genereren van AI-video is geen ondoorgrondelijke kunst, maar een briljante technische prestatie, gebouwd op een stapel slimme en krachtige ideeën. Door de rollen van het diffusieproces, de Transformer, de VAE en de Mixture of Experts te begrijpen, bent u niet langer slechts een gebruiker van deze tools; u bent een geïnformeerde maker.
U bent nu in staat om verder te kijken dan de marketing en de fundamentele architectonische keuzes te begrijpen die de sterke en zwakke punten van een model bepalen. U kunt beter begrijpen waarom sommige modellen uitblinken in natuurkunde, terwijl andere uitblinken in belichting, en waarom sommige open-source zijn, terwijl andere in de cloud blijven.
Deze kennis is macht. Het is de kracht om het juiste gereedschap te kiezen, de mogelijkheden ervan tot het uiterste te benutten en te anticiperen op de volgende grote sprong voorwaarts in dit buitengewone vakgebied. De volgende keer dat u een prompt typt en een wereld op uw scherm ziet ontvouwen, ziet u niet alleen de magie, maar ook de magnifieke machine erachter.
En als u de kracht van al deze magnifieke machines – van de DiT-aangedreven Sora tot de MoE-gestuurde Wan – via één enkele, uniforme interface wilt benutten, is de volgende stap duidelijk.
[3] Chen, J., et al. (2021). Learning Traffic as Videos: A Spatio-Temporal VAE Approach for Traffic Data Imputation. In International Conference on Artificial Neural Networks.