Fontos dolog derült ki a humanoid robotokról: még a legmerészebb jóslatok is valóra válhatnak
Villanyautósok
2026-09-26 07:10
Az AI Futures Project, egy berkeley-i nonprofit szervezet tavaly áprilisban tette közzé az „ AI 2027 ” című, nagy médiavisszhangot kiváltó előrejelzési forgatókönyvét amely a mesterséges intelligencia következő években várható lehetséges fejlődését írja le meglehetősen részletesen. Az írás kombinálja a trendextrapolációt, szakértői visszajelzéseket és narratív történetmesélést, és egy olyan szcenáriót vázol fel, amely szerint – ha minden így megy tovább – 2027-re a mesterséges intelligencia szert tesz a rekurzív önfejlesztés képességére, 2028-ban pedig már belépünk a mesterséges szuperintelligencia korszakába.
Az előrejelzés nemcsak azért érdemel figyelmet, mert azt még az amerikai alelnök, J. D. Vance is elolvasta, hanem azért is, mert idáig meglepően pontosnak bizonyult: az ai2027tracker.com saját értékelési módszertana szerint a 2026 augusztusáig terjedő előrejelzések 85 százaléka teljesült.
Az AI 2027 interaktív vizualizációja a humanoid robotokra vonatkozó predikciókat is tartalmaz, amiből kiolvasható, hogy a szerzők akkori várakozásai szerint 2027-ben fog berobbanni igazán a fejlődés és az év végére a robotok már emberi szintű kognitív képességekre tesznek szert a kékgalléros munkakörökben is.
Látva azt, hogy az elmúlt években milyen lassú és óvatos volt az emberszabású robotok bevezetése a gazdaságban, ez a forgatókönyv nehezen volt hihető. Most szeptember közepén azonban történt valami, ami miatt többé már nem teljesen őrült gondolat azt várni, hogy a humanoidok egy-két éven belül tényleg versenyre kelhetnek az emberi munkaerővel: az amerikai robotikai startup, a Figure bemutatta a Helix 2.5 nevű modelljét, ami új dimenziókat nyitott a fejlesztések előtt.
Today we’re releasing Helix 2.5
We rented 30 homes in the Bay Area. The robots arrived with no additional training and started doing useful work pic.twitter.com/VzrXGYOCKt
— Figure (@Figure_robot) September 17, 2026
De miről is van szó, mi ez a nagy felhajtás a Helix 2.5 körül?
Látványos demonstrációs videókból eddig sem volt hiány. Robotok rendet raknak, ruhákat hajtogatnak vagy csomagokat szortíroznak – ilyet már számtalanszor láttunk, de valahogy mégsem lepték el a robotok a gyárakat és az otthonokat. Ennek oka pedig nem más, mint a nehéz skálázhatóság.
Nézzük meg ezt a Figure példáján keresztül.
A vállalat korábbi modelljei (Helix és Helix 02) még ugyanazzal a gyermekbetegséggel küzdöttek, mint a legtöbb humanoid robot: nehezen volt generalizálható a tudásuk a betanításukhoz használt környezeten túl.
Az eredeti Helix képzése ugyanis még úgy zajlott, hogy először internetről származó képes–szöveges adatok segítségével előtanítottak egy 7 milliárd paraméteres, nyílt súlyú Vision-Language modellt (VLM), nagyon hasonló elven ahhoz, ahogyan a nagy nyelvi modellek, az LLM-ek pretrainingje (előtanítása) zajlik. A robotikában a VLM-eket használják a környezet megértésére, magas szintű tervezésre vagy az utasítások értelmezésére, de egy hagyományos VLM önmagában nem vezérli a robot mozgását. Ehhez olyan rendszerre van szükség, amely a vizuális és nyelvi információkat fizikai cselekvésekké – például a robot karjának vagy kezének mozgásává – alakítja. Az ilyen modelleket nevezzük Vision-Language-Action (VLA) modelleknek, amelyek gyakran egy előtanított VLM-re épülnek. Lényegében ebből a két elemből épült fel a robot agya, azaz a Helix nevű modell.
Ahhoz azonban, hogy a Helix ne csak értse, mit lát és mit kérnek tőle, robotos tapasztalatra is szüksége volt. Ehhez a Figure mintegy 500 órányi, teleoperációval gyűjtött demonstrációs adatot használt fel: emberek távolról irányították a robotokat különböző feladatok végrehajtása közben, a Helix pedig ezekből a példákból tanulta meg, hogyan kell a látott helyzeteket és a kapott utasításokat konkrét mozdulatokra lefordítani.
Ez nem egyetlen feladat betanítását jelentette. Ugyanaz a Helix-modell számos különböző műveletet megtanult, például tárgyakat felvenni és különböző helyekre tenni, fiókokat és hűtőszekrényeket kezelni, sőt két robot együttműködését is irányítani. Az egyik legfontosabb eredmény az volt, hogy a robotok olyan tárgyakkal is boldogultak, amelyekkel a tanítás során soha nem találkoztak: a Figure tesztjeiben több ezer korábban nem látott háztartási tárgyat tudtak felismerni és manipulálni. A Helix tehát már jelentős objektumgeneralizációra volt képes.
A módszernek ugyanakkor maradt egy fontos korlátja. A robotok tanításához az adatokat azokban a környezetekben gyűjtötték, ahol azoknak később dolgozniuk kellett. Vagyis a robot már nem szorult arra, hogy minden egyes tárgyat előre megmutassanak neki, de egy teljesen új helyszínre még nem lehetett egyszerűen beküldeni abban a reményben, hogy ott is ugyanolyan jól boldogul majd.
Az új környezet eltérő elrendezése, tárgyai és vizuális körülményei miatt az új helyszínről is adatokat kell gyűjteni, majd ezek segítségével finomhangolni a rendszert az új munkakörnyezethez. Minél több helyen akarják bevetni a humanoid robotokat, annál többször kell megismételni ezt a folyamatot, ami jelentősen megnehezíti a skálázást.
A robotok fejlesztésében ezért a következő nagy lépést az jelenti, ha azok az objektumok mellett magukra a környezetekre is megtanulnak generalizálni.
A Figure a szeptember 17-én bemutatott Helix 2.5 nevű modellje pedig éppen ezt a képességet demonstrálta azzal, hogy a vállalat robotjai az esetek többségében képesek voltak korábban soha nem látott otthonokban, helyszíni betanítás nélkül valós háztartási feladatokat végrehajtani.
Mi történt pontosan?
A Figure 30 különböző, korábban nem látott lakást bérelt ki, majd a Helix 2.5-t ezekben tesztelte. A modellnek ezekben három különböző háztartási feladatot kellett elvégezniük, de ami miatt különösen izgalmas a kísérlet, hogy ezekből az otthonokból nem gyűjtöttek előzetesen adatokat a modell betanításához. Ez tehát valódi zero-shot environment generalization tesztnek készült. A zero-shot azonban itt az új környezetekre és tárgyakra vonatkozik: magát a három feladatot – a rendrakást, törölközőhajtogatást és ágyazást – másutt gyűjtött adatokkal külön betanították.
A háttérben a Figure új Index nevű adatgyűjtési rendszere áll. Ebben nem elsősorban robotokkal gyűjtenek demonstrációs adatokat, hanem emberek töltenek fel valódi fizikai tevékenységükről egocentrikus (saját szemszögű) nézetből készült videókat, hogy a modell közvetlenül az emberi tapasztalatokból tanulhassa meg a fizikai világ működését.
Az index számai egészen elképesztőek, Augusztus végére a Figure szerint már több mint 16 millió videót gyűjtöttek össze száznál is több országból. Jelenleg 35 percnyi új emberi tapasztalat érkezik másodpercenként, 1000 órányi videóban pedig átlagosan 373 különböző feladat, 1146 különböző tárgy és 116 különböző környezet szerepel. Az adatokat egy ötlépéses szűrési folyamaton (szűrés, csalásellenőrzés, deduplikáció, kiegyensúlyozás, annotáció) futtatják át, mielőtt a Helix 2.5 előtanítására használnák.
Az eredmények magukért beszéltek. Ugyanazt a feladatspecifikus finomhangolást elvégezték egy Index-pretraining nélküli modellen is, amely 9%-os sikerrátát ért el az ismeretlen lakásokban, míg az Indexen előtanított Helix 2.5-ös modell 56%-ot.
A Figure emellett kifejezetten a skálázás hatását is igyekezett mérni. Négy Helix 2.5 modellt tanítottak az Index különböző méretű részhalmazain, összesen 8×-os adatmennyiség-tartományban. Közben a modellméretet, az architektúrát és a feladatspecifikus tanítást változatlanul tartották. Minden egyes adatduplázásnál kiszámíthatóan csökkent a következő robotakció predikciós hibája, ami arra utal, hogy a robotikában is működik egy LLM-szerű skálázási törvény. Sőt, a kisebb tréningfutásokból előre meg tudták becsülni a legnagyobb futás veszteségét, majdhogynem százalékra pontosan.
Az 56%-os sikeresség még messze van attól a megbízhatóságtól, amit az ügyfelek elvárnak, de a Figure kísérlete erős bizonyítékot szolgáltat arra, hogy a nagy mennyiségű és változatos emberi tapasztalaton végzett előtanítás jelentősen javíthatja a robotok környezeti generalizációját.
Ez pedig azért fontos felfedezés, mert ha a modellméret és számítási teljesítmény skálázása is hasonló görbét követ, akkor a humanoid robotok fejlesztése mérnöki problémából egyre inkább skálázási problémává alakul át. Nem kell minden új környezetet külön „megoldani”, és az új feladatok megtanításához szükséges robotos adatmennyiség is csökkenhet: egyre nagyobb általános fizikai világmodellt lehet előtanítani, majd erre építeni a konkrét képességeket. Ez pedig végeredményben ahhoz vezethet, hogy a humanoid robotok is az LLM-ekhez hasonló gyorsasággal fejlődhetnek a következő években és a szűk keresztmetszet fokozatosan eltolódhat a robotok kognitív képességeitől a hardvergyártás felskálázása felé (ez utóbbi problémáról ebben a cikkünkben írtunk részletesebben).
Egy évvel ezelőtt az AI-2027 forgatókönyve azért tűnt különösen merésznek, mert nem látszott világosan, hogyan lehet a robotok képességeit elég gyorsan fejleszteni, a Helix 2.5 után viszont már látszik erre egy lehetséges mechanizmus.
Milyen gyorsan lehet felskálázni a humanoid robotok gyártását évi 10 millió darabra?