Η Google DeepMind παρουσιάζει το Gemini Robotics ER 2 ως το νέο «υψηλού επιπέδου μυαλό» για ρομπότ, δηλαδή ένα σύστημα που δεν εκτελεί μόνο κινήσεις αλλά οργανώνει βήματα, καταλαβαίνει το περιβάλλον και συνεργάζεται με άλλα μοντέλα ελέγχου. Η εταιρεία λέει ότι το νέο μοντέλο φέρνει τα agentic συστήματα πιο κοντά σε πραγματικές φυσικές εργασίες, όπου ο χρόνος αντίδρασης και η παρακολούθηση της προόδου είναι εξίσου κρίσιμα με τη βασική χωρική αντίληψη.
Σε πρακτικό επίπεδο, η ανακοίνωση έχει σημασία επειδή το Gemini Robotics ER 2 διατίθεται δημόσια μέσω Gemini API και Google AI Studio, ενώ εμφανίζεται και σε private preview στο Gemini Enterprise Agent Platform. Αυτό δείχνει ότι η Google δεν το παρουσιάζει ως καθαρά ερευνητικό demo, αλλά ως προϊόν πάνω στο οποίο developers και επιχειρήσεις μπορούν να αρχίσουν να χτίζουν ρομποτικές ροές εργασίας.
Από το chat στο εργοστάσιο και την αποθήκη
Η βασική ιδέα του Gemini Robotics ER 2 είναι ότι ένα ρομπότ δεν αρκεί να «βλέπει» σωστά τον χώρο. Πρέπει να αποφασίζει γρήγορα, να σχεδιάζει πολλά βήματα μαζί και να καταλαβαίνει πότε ένα υποέργο όντως ολοκληρώθηκε πριν προχωρήσει στο επόμενο. Η Google λέει ότι το μοντέλο μπορεί να συνομιλεί με ανθρώπους, να κατανοεί τον φυσικό κόσμο και να αναθέτει την τελική κινητική εκτέλεση σε χαμηλότερου επιπέδου vision-language-action μοντέλα.
Σύμφωνα με την ανακοίνωση, το σύστημα μπορεί επίσης να καλεί εργαλεία όπως το Google Search ή άλλες user-defined functions. Αυτό είναι κρίσιμο για όποιον βλέπει τα ρομπότ όχι ως μεμονωμένες μηχανές αλλά ως agents που αντλούν πληροφορία, συντονίζουν APIs και αντιδρούν σε απρόοπτα χωρίς να σταματούν κάθε λίγα δευτερόλεπτα για νέο prompt.
Τι αλλάζει σε σχέση με το ER 1.6
Η Google υποστηρίζει ότι το ER 2 είναι σαφές βήμα μπροστά από το Gemini Robotics ER 1.6. Με συνεχή ροή βίντεο, τα ρομπότ μπορούν πλέον να παρακολουθούν την πρόοδό τους σε πραγματικό χρόνο, να εντοπίζουν αν κάτι πήγε λάθος και να ξέρουν πότε πρέπει να περάσουν στο επόμενο βήμα. Στο ίδιο πακέτο έρχεται και η υποστήριξη για multi-robot collaboration, ώστε διαφορετικοί τύποι ρομπότ να μοιράζονται σημασιολογική κατανόηση και να ολοκληρώνουν μαζί εργασίες που δεν χωρούν σε ένα μόνο μηχάνημα.
Η DeepMind έδωσε και συγκεκριμένα παραδείγματα. Σε demo με το Spot της Boston Dynamics, το μοντέλο ορχηστρώνει APIs πλοήγησης και κίνησης του βραχίονα για να εκτελεί αιτήματα σε φυσική γλώσσα, όπως η ανάκτηση ενός αντικειμένου. Παράλληλα, η εταιρεία δείχνει σενάρια συνεργασίας ανάμεσα στο Apollo 2 της Apptronik και το Franka F3 Duo, προβάλλοντας την ιδέα ότι η επόμενη φάση της ρομποτικής θα βασιστεί περισσότερο στον συντονισμό παρά σε μία μόνο «έξυπνη» συσκευή.
Οι αριθμοί που επικαλείται η Google
Στα benchmarks που δημοσίευσε η ίδια η εταιρεία, το Gemini Robotics ER 2 πέτυχε 57,4% ακρίβεια σε tasks progress classification, όπου το σύστημα πρέπει να εκτιμά σε ποιο στάδιο μιας εργασίας βρίσκεται κάθε frame ενός video feed. Για moment finding, δηλαδή για τον εντοπισμό του ακριβούς σημείου όπου συνέβη ένα κρίσιμο γεγονός, η Google αναφέρει 91,3% ακρίβεια και μέση απόσταση σφάλματος 0,96 δευτερόλεπτα. Η εταιρεία προσθέτει ότι το μοντέλο πετυχαίνει αυτή την επίδοση με τετραπλάσια ταχύτητα εκτέλεσης σε σχέση με μεγαλύτερες κατηγορίες μοντέλων, στοιχείο που παρουσιάζει ως ουσιαστικό για ασφαλή λειτουργία στον φυσικό κόσμο.
Η Google δίνει επίσης έμφαση στην ασφάλεια. Αναφέρει ότι το ER 2 βελτιώνεται σε benchmarks Safety Instruction Following και Human Proximity, ενώ σε ένα από τα παραδείγματα το ανθρωποειδές ρομπότ σταματά όταν άνθρωπος πλησιάζει και συνεχίζει μόνο όταν ο χώρος καθαρίσει. Αυτά τα αποτελέσματα παραμένουν εταιρικοί ισχυρισμοί και όχι ανεξάρτητη αξιολόγηση, αλλά δείχνουν καθαρά προς ποια κατεύθυνση κινείται η αγορά: λιγότερο εντυπωσιακά demos και περισσότερα συστήματα που πρέπει να αποδείξουν ότι μπορούν να λειτουργήσουν γρήγορα, συνεργατικά και με σαφείς περιορισμούς ασφαλείας.
Για την ευρύτερη αγορά AI, η ανακοίνωση έχει βάρος επειδή μεταφέρει τον ανταγωνισμό από τα chat interfaces σε βιομηχανικά, αποθηκευτικά και επιχειρησιακά περιβάλλοντα. Αν τέτοια μοντέλα γίνουν αξιόπιστα στην πράξη, το ερώτημα δεν θα είναι μόνο ποιο AI γράφει καλύτερα κείμενα ή κώδικα, αλλά ποιο μπορεί να οργανώσει πραγματικές μηχανές μέσα σε χώρους όπου το λάθος κοστίζει χρόνο, χρήμα και ασφάλεια.