AgentHands: Revoluția gesturilor interactive în realitatea extinsă (XR) dezvoltată de Google

Categorii: ai · Dificultate: intermediar

Attila Kiraly — Strateg AI & Educator · · 3 min citire

O reprezentare a unui avatar digital într-un mediu de realitate augmentată folosind gesturi ale mâinilor pentru a interacționa cu obiecte virtuale.

Publicat original: 25 august 2026

Google Research a prezentat AgentHands, un sistem inovator care permite agenților AI din mediile XR să utilizeze gesturi ale mâinilor corelate cu mediul fizic înconjurător. Această tehnologie îmbunătățește naturalismul interacțiunilor om-mașină prin coordonarea vizuală a mișcărilor în timp real.

Ce s-a întâmplat

Cercetătorii de la Google au anunțat lansarea AgentHands, un cadru tehnologic avansat conceput pentru a genera gesturi ale mâinilor interactive și ancorate spațial pentru agenții digitali din Realitatea Extinsă (XR). Spre deosebire de modelele anterioare care se bazau pe animații predefinite sau gesturi generice, AgentHands permite avatarelor AI să interacționeze vizual cu obiectele din mediul utilizatorului, indicând, atingând sau manipulând elemente virtuale și fizice într-un mod fluid și contextulizat.

Context tehnologic

Tehnologia din spatele AgentHands se bazează pe modele de limbaj de mari dimensiuni (LLM) și sisteme de viziune computerizată. În mod tradițional, agenții XR (cum ar fi asistenții holografici) aveau dificultăți în a corela vorbirea cu acțiunile fizice. AgentHands rezolvă acest lucru prin utilizarea unui sistem de „ancorare spațială” (spatial grounding). Aceasta înseamnă că AI-ul nu doar „vorbește”, ci înțelege coordonatele 3D ale camerei în care se află utilizatorul. Sistemul generează traiectorii pentru mâini care sunt sincronizate cu fluxul conversațional, permițând agentului să arate spre un obiect specific despre care discută sau să simuleze interacțiunea cu acesta.

De ce contează

Această inovație reprezintă un pas critic către Computing-ul Spațial (Spatial Computing). În prezent, interacțiunea cu asistenții digitali este predominant vocală sau textuală. AgentHands adaugă o componentă non-verbală esențială: limbajul corpului. Impactul este major în domenii precum:

Impact

Pe termen scurt, AgentHands va îmbunătăți realismul aplicațiilor de asistență AR pe dispozitive precum ochelarii inteligenți. Utilizatorii vor simți o conexiune mai naturală cu agenții AI, reducând „valea stranie” (uncanny valley) – acea senzație de disconfort cauzată de avatarele care par aproape umane, dar se mișcă robotic. Pe termen mediu, am putea vedea standardizarea acestor gesturi în sistemele de operare spațiale, transformând modul în care navigăm prin interfețe digitale fără a atinge ecrane fizice.

Ce urmează

Următorul pas pentru Google Research este integrarea acestui sistem cu modele multimodale care pot procesa simultan video, audio și date spațiale în timp real. Ne putem aștepta la agenți AI capabili să anticipeze nevoile utilizatorului prin observarea direcției privirii acestuia și utilizarea gesturilor pentru a oferi ajutor proactiv. Viitorul interacțiunii om-AI va fi unul în care bariera dintre digital și fizic devine aproape invizibilă.

Surse

Termeni explicați din articol

Sursa originală: research.google

Vrei să înveți bazele? Ce este Web3?

Întrebări frecvente

Ce este AgentHands?

Este un sistem dezvoltat de Google care permite avatarelor AI să folosească gesturi naturale ale mâinilor în realitatea augmentată sau virtuală.

Cum funcționează 'ancorarea spațială'?

Sistemul analizează mediul 3D din jurul utilizatorului și ghidează mâinile avatarului către obiectele relevante menționate în conversație.

De ce sunt importante gesturile pentru un AI?

Gesturile fac comunicarea mult mai naturală și umană, ajutând utilizatorul să înțeleagă mai rapid explicațiile vizuale.

Este AgentHands disponibil pentru public?

Momentan este un proiect de cercetare Google, dar tehnologia va fi probabil integrată în viitoarele dispozitive XR și asistenți AI.

Poate AgentHands să interacționeze cu obiecte fizice?

Vizual, da. Agentul poate părea că atinge sau arată spre un obiect real din camera utilizatorului, facilitând instrucțiunile de tip 'pas cu pas'.

Termeni din Glosar

Continuă să înveți

Descoperă mai multe despre tehnologie, automatizare și Web3 în EduWeb Academy.

Explorează Academy