Τεχνολογία

Η Google φέρνει reasoning σε πραγματικό χρόνο στις φωνητικές AI agents

T
Toggle Tech Team
📅 September 25, 2026 ⏱ 3 min read 👁 5 views
Η Google φέρνει reasoning σε πραγματικό χρόνο στις φωνητικές AI agents

Τα Gemini 3.8 Live και 3.8 Live Extended Thinking φέρνουν φυσικό διάλογο, οπτικό context, πολυβήματο reasoning και background tool calls σε φωνητικούς AI agents.

Η Google παρουσιάζει δύο νέα μοντέλα φωνητικής τεχνητής νοημοσύνης που δεν περιορίζονται στο να απαντούν γρήγορα. Τα Gemini 3.8 Live και Gemini 3.8 Live Extended Thinking μπορούν να συνεχίζουν τη συνομιλία ενώ επεξεργάζονται πιο σύνθετα βήματα, βλέπουν το περιβάλλον τους και εκτελούν εργαλεία στο παρασκήνιο.

Δύο μοντέλα για διαφορετικό ρυθμό εργασίας

Το Gemini 3.8 Live έχει σχεδιαστεί για κλίμακα και χαμηλότερο κόστος. Συνδυάζει φυσικό διάλογο, γρήγορες απαντήσεις και οπτική κατανόηση, ώστε μια φωνητική εφαρμογή να μη μοιάζει με σειρά από ερωτήσεις και παύσεις.

Το Gemini 3.8 Live Extended Thinking απευθύνεται σε απαιτητικότερες εργασίες. Μπορεί να κάνει πολυβήματους συλλογισμούς και να μιλά ταυτόχρονα, ενημερώνοντας τον χρήστη ότι ελέγχει κάτι ή περιγράφοντας την πρόοδο μιας εργασίας, χωρίς να διακόπτει τη ροή της συζήτησης.

Η φωνή γίνεται διεπαφή για εργαλεία

Η βασική αλλαγή δεν είναι μόνο η ταχύτητα της απάντησης. Τα μοντέλα μπορούν να επεξεργάζονται οπτικές εισόδους σχεδόν σε πραγματικό χρόνο, να μεταβαίνουν αυτόματα ανάμεσα σε 97 γλώσσες και να καλούν εργαλεία ή APIs στο παρασκήνιο, ενώ η συνομιλία συνεχίζεται.

Στην πράξη, αυτό σημαίνει ότι ένας χρήστης μπορεί να ζητήσει από έναν agent να οργανώσει μια σύνθετη εργασία χωρίς να περιμένει σιωπηλά κάθε επιμέρους βήμα. Η Google παρουσιάζει παραδείγματα όπως ζωντανή βοήθεια κατά την εκπαίδευση εργαζομένων, ανάλυση μιας παρτίδας σκάκι και συντονισμό κρατήσεων με ασύγχρονες κλήσεις συναρτήσεων.

Τι δείχνουν τα benchmarks

Η Google αναφέρει ότι το Extended Thinking κατέλαβε την πρώτη θέση στον Speech to Speech Quality Index της Artificial Analysis, με βαθμολογία 82,6. Στα benchmarks για agentic εργασίες πέτυχε 68,6% στο τ-Voice και 35,1% στο τ-Voice-banking της Sierra, ενώ στο Big Bench Audio σημείωσε 97,7%.

Οι αριθμοί αυτοί είναι χρήσιμοι ως ένδειξη δυνατοτήτων, αλλά δεν αποτελούν από μόνοι τους εγγύηση για κάθε πραγματική εφαρμογή. Τα benchmarks μετρούν συγκεκριμένες ροές, και η ποιότητα ενός voice agent εξαρτάται επίσης από την καθυστέρηση δικτύου, τα εργαλεία που του παραχωρούνται, τα δικαιώματα πρόσβασης και τον τρόπο με τον οποίο χειρίζεται τα λάθη.

Από το API στις καθημερινές εφαρμογές

Τα δύο μοντέλα διατίθενται σταδιακά μέσω του Gemini API και του Google AI Studio. Το Live περνά επίσης στο Search Live, ενώ το Extended Thinking ενσωματώνεται στο Gemini Live και, για συνδρομητές, σε λειτουργίες του Workspace όπως τα Docs, Gmail και Keep. Για επιχειρήσεις, η Google αναφέρει ιδιωτική προεπισκόπηση στο Gemini Enterprise.

Η διάθεση γίνεται παράλληλα με ένα οικοσύστημα πλατφορμών όπως τα LangChain, LiveKit, Pipecat και Vercel, που αναλαμβάνουν μέρος της υποδομής streaming και επιτρέπουν στους developers να εστιάσουν στη συμπεριφορά της εφαρμογής. Αυτό δείχνει ότι η Google θέλει οι φωνητικοί agents να γίνουν παραγωγικά εργαλεία και όχι απλώς εντυπωσιακά demos.

Η λεπτομέρεια της ασφάλειας

Η συνεχής συνομιλία και οι background ενέργειες κάνουν την αλληλεπίδραση πιο φυσική, αλλά αυξάνουν και την ανάγκη για σαφή όρια. Όταν ένας agent μπορεί να βλέπει, να καλεί APIs και να χειρίζεται εργασίες ενώ ο χρήστης μιλά, η εφαρμογή πρέπει να εξηγεί τι εκτελεί, να ζητά επιβεβαίωση όπου χρειάζεται και να περιορίζει τα δικαιώματά της.

Η Google αναφέρει επίσης ότι ο παραγόμενος ήχος από τα προϊόντα AI της φέρει αόρατη υδατογράφηση SynthID, ώστε να μπορεί να αναγνωρίζεται. Το σημαντικότερο τεστ, πάντως, θα είναι αν οι agents παραμένουν αξιόπιστοι όταν η συνομιλία γίνεται ασαφής, τα εργαλεία αποτυγχάνουν ή μια εργασία απαιτεί ανθρώπινη κρίση.

T

Toggle Tech Team

Editor-in-chief at Toggle. Covering technology and global affairs.