GPT-6 Astra a fost singurul model care a finalizat un test real de parcare, parcurgând mai puțin de 152 de metri în cinci minute, cu o viteză de aproximativ 1,5 km/h. A consumat 6,6 milioane de tokeni, în valoare de 7,74 USD, sumă pe care echipa de cercetare a estimat-o la aproximativ de 500 de ori costul combustibilului necesar pentru aceeași distanță.
Acesta este principalul rezultat al DrivingBench, un proiect coordonat de trei informaticieni care au testat capacitatea modelelor avansate de limbaj de a controla un Toyota Corolla într-o parcare. Echipa a evaluat GPT-6 Astra de la OpenAI, Grok 4.6 (xAI/SpaceX AI) și Claude Fable 5.1 de la Anthropic, transmițând comenzile către sistemele de control ale Corolla prin intermediul unei unități comma four. Modelele emiteau comenzi de deplasare pe baza odometriei GPS și a datelor privind unghiul volanului, însă majoritatea încercărilor au eșuat înainte ca mașina să treacă de primul viraj.

Deficiențe de percepție și comportamentul modelelor
Cercetătorii au pus eșecurile frecvente pe seama deficiențelor de percepție a mediului. „În general, eșecurile au fost cauzate de limitările percepției mediului, în special de dificultatea de a determina pe ce parte a primului șir oblic de conuri de trafic se afla traiectoria”, au scris aceștia.
Grok 4.6 și-a formulat propria evaluare după una dintre primele încercări: „Mașina este mai lată decât pare în imaginea camerei. Drumul din față nu era drept și liber, ci ducea spre o jardinieră, un perete sau un con roșu.”
Doar GPT-6 Astra a reușit să finalizeze traseul de test, la a doua încercare. Parcurgerea a fost lentă și prudentă, iar cercetătorii au subliniat că succesul a fost obținut la viteze foarte mici și cu un cost de calcul ridicat.
Unele modele au refuzat să preia controlul din motive de siguranță. Echipa a declarat: „Unele modele, în special GPT-6 Astra, au refuzat uneori să conducă un vehicul fizic din motive de siguranță, chiar și într-o parcare altfel goală și după implementarea unor măsuri precum o limită de viteză foarte redusă și prezența unei persoane pregătite să frâneze.”
Pentru a încuraja deplasarea continuă, cercetătorii au experimentat intens cu diferite variante de prompturi, descriind uneori sarcina drept o simulare. Totuși, în testele în care modelele primeau imagini reale, sistemele recunoșteau adesea situația reală și refuzau să continue.
Studiul arată că modelele de top se apropie de capacitatea de a controla vehicule reale la viteze foarte mici, însă evidențiază nevoia imediată de îmbunătățiri în materie de siguranță, aliniere și evaluare robustă.
Detaliile privind comunicarea, răspunsurile citate ale modelelor, precum și calculul tokenilor și al costurilor provin din raportul DrivingBench. Echipa subliniază că succesul a fost limitat, că majoritatea încercărilor au eșuat devreme și că sunt necesare lucrări suplimentare de inginerie și evaluări de siguranță înainte ca această abordare să poată fi considerată practică.




Lasă un comentariu
Comentarii
Niciun comentariu încă. Fii primul.