Évekig úgy tűnt, a segítőkész humanoid robotok ígérete egy örökös demókörön futó, 30 másodpercig lenyűgöző, de aztán a labor falai közé szorult, előre beprogramozott feladatokat végző jelenség.
Egy kockát persze fel tudtak venni, de egy zsúfolt szobában már úgy botorkáltak, mint egy túlpörgött kisgyerek.
Most a Google DeepMind gyökeres megoldással állt elő a Gemini Robotics 2 nevű AI platformjával, ami nem egyszerű szoftverfrissítés, sokkal inkább egy komplett agytranszplantáció a legkülönfélébb robotok számára.
A koncepció megtévesztően egyszerű: egy egységes “intelligencia réteget” hoznak létre, amely bármely robotnak képessé teszi, hogy érzékeljen, gondolkodjon és cselekedjen a kusza, kiszámíthatatlan emberi világban.
Ez nem csupán egyetlen kar finomabb motoros vezérléséről szól; a Google ezt “teljes test intelligenciának” (full body intelligence) nevezi.
Most először egyetlen AI modell úgy irányít egy humanoidot a lábujjától az ujjbegyéig, hogy az összehangolja az egyensúlyt, a mozgást és a manipulációt egyetlen, gördülékeny folyamatba.
Ez a különbség aközött, hogy beprogramozzuk egy robot ízületeit, vagy saját elmével ruházzuk fel.
A Háromfejű AI Cerberus A Gemini Robotics 2 szívében nem egy, hanem három specializált modell dolgozik összehangoltan.
Képzeljük el úgy, mint egy parancsnoki struktúrát arra, hogy a fizikai világban is elvégezze a feladatokat.
Elsőként ott van maga a Gemini Robotics 2 , a mester VLA (vision-language-action – látás-nyelv-cselekvés) modell.
Ez az igásló, amely egy magas szintű parancsot, mint például “tedd a locsolókannát az alsó polcra”, a motoros vezérlések komplex sorozatává fordít le, ami a járáshoz, hajlításhoz, egyensúlyozáshoz és a tárgy elhelyezéséhez szükséges.
Másodikként jön a Gemini Robotics ER 2 , az “Embodied Reasoning” (megtestesült érvelés) modell.
Ez a stratéga.
Folyamatos videó streamet figyel a valós világból, hogy megértse a kontextust, több lépéses feladatokat tervezzen, és még korrigáljon is, ha valami balul sül el.
Ha a fő modell a test, akkor az ER 2 a magas szintű agy, amely kitalálja a mit , mielőtt a VLA kitalálná a hogyan -t.
Akár külső eszközöket is bevethet, mint például a Google Keresőt, hogy informálja a terveit.
Végül pedig ott van az On-Device 2 , a gyors átalakuló művész.
Ez a könnyűsúlyú VLA arra van optimalizálva, hogy helyben fusson egy robot hardverén, de a nagy dobása az adaptáció.
A Google állítása szerint mindössze néhány óra alatt, kevesebb mint 200 demonstráció felhasználásával, teljesen új robottesthez – különböző érzékelőkkel, ízületekkel és mechanikával – is adaptálható.
Ez egy monumentális lépés elfelé attól a hagyományos, hardverspecifikus AI fejlesztéstől, ami évtizedekig sújtotta az iparágat. .x-post-container { margin: 1.5rem 0; display: flex; justify-content: center; } A Műhelyasztaltól a Nagybetűs Világba Bármely robotikai AI igazi próbája az, hogy mennyire képes olyan feladatokat kezelni, amelyek nagyobb finomságot igényelnek, mint egy gyári összeszerelő sor.
A Gemini Robotics 2 kifejezetten arra készült, hogy túllépjen az asztali feladatokon és komplex, valós szcenáriókba is bevethető legyen.
A demók az ügyesség új szintjét mutatják be, a villanykörte kicsavarásától (92%-os sikerességi rátával) egy ötujjas, 22 szabadságfokú kézzel, egészen a csomó kötéséig egy szemeteszsákon (egy szerényebb, 44%-os sikerességi rátával).
Ez a képességbeli ugrás annak köszönhető, hogy az egész testet bevonják a döntéshozatali folyamatba.
Az Apptronik Apollo 2 humanoidjával végzett teszteken a robot 76,3%-os sikerességi rátával emelt le tárgyakat a polcról – egy olyan feladat, ami összehangolt járást, egyensúlyozást, nyúlást és megfogást igényel.
De talán a leginkább előremutató funkció a többrobotos együttműködés.
A Gemini Robotics ER 2 központi koordinátorként működhet, felosztva a feladatokat teljesen különböző típusú robotok között.
Képzeljünk el egy Apollóhoz hasonló humanoidot, amint átad egy tárgyat egy kerekes mobil robotnak szállításhoz, és mindegyik megérti a szerepét egy nagyobb munkafolyamatban.
Itt válik világossá a platform ambíciója: egy közös nyelvet teremteni a gépek számára az együttműködéshez. .x-post-container { margin: 1.5rem 0; display: flex; justify-content: center; } A Robotok Androidja?
A Gemini Robotics 2-vel a Google stratégiai lépést tesz, hogy a hardverek következő generációjának alapvető operációs rendszerévé váljon.
Azzal, hogy egy erőteljes, adaptálható AI-t hoznak létre, amely elméletileg bármilyen gépen futhat, az “agy” szállítójaként pozicionálják magukat egy virágzó robot “testek” ökoszisztémájához.
A fejlesztők és kutatók számára jó hír, hogy ennek az erőteljes új eszköznek egyes részei már elérhetők.
A Gemini Robotics ER 2 mostantól elérhető a fejlesztők számára a Gemini API-n és a Google AI Studio-n keresztül, lehetővé téve számukra, hogy olyan alkalmazásokat építsenek, amelyek kihasználják annak fejlett érvelési képességeit.
Ez kinyitja az ajtót a szélesebb közösség előtt a kísérletezésre a többlépéses tervezéssel és a valós idejű videóértelmezéssel saját robotikai projektjeikhez.
Persze a lélegzetelállító demók és egy valóban hasznos, megbízható robot között továbbra is szakadék tátong.
A valós világ végtelenül kaotikusabb, mint egy kontrollált labor.
De azáltal, hogy egy olyan általánosított intelligenciára összpontosítanak, amely képes tanulni, alkalmazkodni és együttműködni, a Google DeepMind hidat épít.
Nem csupán egy okosabb robotot készítenek; egy tervrajzot próbálnak létrehozni ahhoz, hogy minden robot okosabbá váljon.
És ezúttal úgy tűnik, a demók végre felnőnek a valósághoz. .x-post-container { margin: 1.5rem 0; display: flex; justify-content: center; }


Vélemények és hozzászólások
Vitatkozz a témáról kulturáltan. A hozzászólásokra a közösségi irányelveink és az adatvédelmi tájékoztató vonatkozik.