2024-ben még filozófiai kérdésként tettük fel: mi történik, ha az AI-val egyre könnyebben másolhatóvá válik a valóság? 2025-ben már beléptünk egy olyan AI-videóba, amely menet közben generálta körülöttünk a világot. 2026 szeptemberében pedig megérkezett egy újabb mérföldkő: a generált világ már nemcsak reagálni próbál ránk, hanem emlékezni is arra, mi történt benne.
Nem arról van szó, hogy „megszületett a Mátrix”. Sokkal érdekesebb ennél: néhány olyan technológiai építőkocka, amely néhány éve még science fictionnek hatott, ma már működő kutatási és termékdemókban jelenik meg. Nézzük végig, hogyan jutottunk el idáig – és mi hiányzik még.
2024: amikor még csak azt kérdeztük, épül-e a Mátrix
2024-ben a CreativeSpoton a mesterséges intelligencia és kreativitás kapcsolatáról írva már felmerült a Mátrix-párhuzam. Akkor ez elsősorban filozófiai kérdés volt: ha képet, hangot, szereplőt és végül mozgó valóságot is képesek vagyunk szintetikusan előállítani, hol húzódik majd a határ a rögzített és a generált valóság között?
A 2024-es CreativeSpot-cikkünkben még nem volt olyan általánosan kipróbálható technológia, amely folyamatosan körénk generált volna egy interaktív világot. Egy évvel később már volt.
2025: beléptünk egy videóba, ami menet közben született
2025 májusában az Odyssey bemutatta az Odyssey-1-et, egy valós idejű, játszható world model kutatási előzetesét. A hagyományos AI-videóval szemben nem egy kész, lezárt klipet adott vissza: a képsor tovább generálódott, miközben a felhasználó interakcióba lépett vele.
Mi ezt akkor ki is próbáltuk a CreativeSpoton. Az élmény egyszerre volt lenyűgöző és kezdetleges. Látszott, hogy valami új születik, de ugyanilyen jól látszottak a korlátai: a világ könnyen szétesett, a vizuális következetesség bizonytalan volt, és az egész inkább technológiai bepillantásnak érződött, mint kész médiumnak.
A fontos változás nem az volt, hogy az AI szebb videót generált. Hanem az, hogy a videó többé nem feltétlenül volt előre eldöntött.
2025 vége: a videó válaszolni kezd
Az Odyssey-2 már tovább tolta ezt az ötletet. A fejlesztők úgy fogalmaztak: mi lenne, ha a videó nem passzív felvétel lenne, hanem valami, ami azonnal reagál? A rendszerben szöveges utasításokkal lehetett beavatkozni a futó videóba, miközben az tovább generálódott.
Ezzel egy fontos határ kezdett elmosódni. A néző már nem egyszerűen néző. Valamilyen szinten résztvevővé válik, miközben a tartalom létrehozása és fogyasztása ugyanabban a pillanatban történik.
2026: már nem elég, hogy szép legyen – működnie is kell a világnak
2026-ban az Odyssey-2 Max fejlesztési iránya már egyre hangsúlyosabban a fizika, az interakció és a hosszabb távú stabilitás felé fordult. Ez alapvető különbség. Egy öt másodperces AI-klipben egy apró fizikai képtelenség akár észrevétlen maradhat. Egy olyan világban azonban, amelyben percekig mozgunk és döntéseket hozunk, minden hiba továbbgyűrűzhet.
A world modelnek ezért nemcsak azt kell megtanulnia, hogyan néz ki a következő képkocka. Valamilyen használható reprezentációt kell kialakítania arról is, hogyan függ össze a tér, a mozgás, az objektumok és az idő.
2026 szeptember: a világ emlékezni kezd
2026. szeptember 22-én a PixVerse bemutatta az R2-t. Ez nem az Odyssey következő verziója – két külön fejlesztőcsapatról és külön technológiáról beszélünk –, de a fejlesztési irány között nagyon erős a párhuzam.
A PixVerse R2 egyik legérdekesebb újdonsága a persistent world state. Egy prompt, egy mozdulat vagy egy hangjel nem csak az aktuális pillanatot változtathatja meg: frissítheti a futó világ állapotát, és ennek hatása később is megmaradhat. A PixVerse bemutatója szerint az R2 hosszabb ideig próbál konzisztens maradni, emlékszik a sessionben történtekre, és szöveget, referenciát, hangot és vezérlési inputot is ugyanabba a futó világba fogad.
Ez még messze nem egy tökéletes szimulált univerzum. Maga a PixVerse is alapvető problémaként kezeli a hosszú futás közben jelentkező driftet, a hibák felhalmozódását és a valós idejű működéshez szükséges alacsony késleltetést.
2025-ben az volt a meglepetés, hogy mozoghattunk egy generált világban. 2026-ban az kezd érdekessé válni, hogy a világ emlékszik-e arra, mit tettünk benne.
Hogyan jutottunk el idáig?
Kattints a mérföldkövekre: minden pontnál azt mutatjuk, mi változott az előző lépcsőhöz képest.
Még csak azt kérdezzük: épül-e a Mátrix?
Az AI egyre több darabot képes szintetikusan előállítani a valóságból, de a folyamatos, bejárható generált világ még inkább gondolatkísérlet.
És itt válik igazán érdekessé a Mátrix-párhuzam
A Mátrix technológiai értelemben érdekes gondolata nem pusztán az, hogy virtuális valóságot látunk. Hanem az, hogy létezik egy folyamatosan működő, szabályokkal rendelkező szimulált világ, amelyben szereplők vannak, események történnek, és a rendszernek fenn kell tartania saját belső következetességét.
Ma ettől még nagyon messze vagyunk. De már külön-külön felismerhető néhány építőkocka: valós idejű generálás, interakció, multimodális vezérlés, fizikai következetességre irányuló fejlesztés, tartósabb világállapot és memória.
Mi történik a filmkészítéssel, ha nem videót generálunk, hanem világot?
Számunkra ez a legérdekesebb kérdés. A mai AI-videós workflow többnyire klipalapú. Leírjuk a jelenetet, generálunk néhány másodpercet, majd ha rossz a kamera, a szereplő vagy a mozgás, módosítunk és újragenerálunk. Ezután a klipeket vágásban és utómunkában próbáljuk egységes filmmé szervezni.
Egy valóban stabil world model esetében ennek a logikája megfordulhat. Először létrejönhet a helyszín, a szereplők és a világ állapota. Mi pedig nem új videót kérünk minden változtatásnál, hanem rendezőként dolgozunk ugyanabban a világban: kamerát helyezünk el, eseményt indítunk, szereplőt irányítunk, majd egy másik kameraállásból újra felvesszük ugyanazt.
Ez ma még lehetőség, nem kész gyártási módszer. A hosszú távú konzisztencia, a pontos rendezői kontroll és a professzionális képminőség továbbra is komoly probléma. De a fejlődési irány már látható.
A következő mérföldkövek
- Tartós karakter: ugyanaz a személy hosszú időn keresztül ugyanaz marad.
- Hosszú memória: a világ nem csak néhány korábbi eseményre emlékszik.
- Megbízható fizika: a tárgyak és szereplők következetesen viselkednek.
- Rendezői kontroll: kamera, fény, mozgás és színészi akció pontosan ismételhető.
- Autonóm történet: a szereplők és események nem kizárólag előre megírt ágakon mozognak.
Mikor válik egy generált videó szimulációvá?
Talán ez a legjobb kérdés, amit most feltehetünk. Egy öt másodperces AI-videó egyértelműen tartalom. De mi történik, ha a generálás nem áll le? Ha beléphetünk, változtathatunk rajta, a világ megőrzi a változtatást, a szereplők emlékeznek, és a történet másképp folytatódik attól függően, mit teszünk?
2024-ben még azt kérdeztük, épül-e a Mátrix. 2025-ben először beléptünk egy generált világba. 2026-ban ez a világ emlékezni kezdett.
A következő kérdés már nem az, hogy tud-e az AI videót generálni. Hanem az, hogy meddig tud életben tartani egy világot.
Kapcsolódó CreativeSpot-anyagok
- Hogyan forradalmasítja a mesterséges intelligencia a kreativitást – a 2024-es Mátrix-gondolat
- Új interaktív AI-videó a horizonton – a 2025-ös saját Odyssey-tesztünk
- Runway valós idejű AI-videó: eltűnhet a várakozás a generálásból?
Források
- Odyssey – Introducing Odyssey-1: A Playable World Model, 2025. május 28.
- Odyssey – Introducing Odyssey-2: A General-Purpose World Model, 2025. október 27.
- Odyssey – Introducing Odyssey-2 Max: Scaled World Simulation, 2026.
- PixVerse – R2: Scaling Real-Time Omni World Models, 2026. augusztus 23.
- PixVerse – Introducing R2: Persistent, Playable Worlds, 2026. szeptember 22.



