Η υπόθεση που περιγράφει το Ars Technica δεν είναι απλώς ένα ακόμη παράδειγμα ανακριβούς απάντησης από chatbot. Σύμφωνα με ρεπορτάζ του CNN, που επικαλείται τέσσερις πηγές με γνώση του περιστατικού, μια αναφορά αμερικανικών υπηρεσιών πληροφοριών χαρακτήρισε λανθασμένα το φορτίο κινεζικού πλοίου ως υλικό για πρόγραμμα πυρηνικών όπλων. Το αμερικανικό επιτελείο φέρεται να προετοίμαζε επιχείρηση αναχαίτισης και επιβίβασης, με αεροπορική υποστήριξη, πριν εντοπιστεί το λάθος.
Πώς μια εσφαλμένη αναφορά έφτασε τόσο μακριά
Ο αναλυτής της αμερικανικής Διοίκησης Ειδικών Επιχειρήσεων χρησιμοποίησε chatbot για να αναλύσει αναφορές σχετικά με το δηλωμένο φορτίο του πλοίου. Το σύστημα φέρεται να συνδύασε πληροφορίες ανοικτών πηγών με απόρρητα δεδομένα σημάτων και να παρήγαγε αναφορά που παρουσίαζε ως γεγονός μια ανυπόστατη ταυτοποίηση του υλικού.
Το κρίσιμο σημείο δεν ήταν μόνο ότι το μοντέλο «παραισθήθηκε». Ήταν ότι το αποτέλεσμα πέρασε μέσα από μια επαγγελματική διαδικασία, απέκτησε το κύρος επίσημου εγγράφου και επηρέασε αποφάσεις σε μια αλυσίδα διοίκησης όπου το κόστος ενός λάθους μπορεί να είναι γεωπολιτικό.
Το πρόβλημα δεν είναι η βεβαιότητα του μοντέλου
Τα μεγάλα γλωσσικά μοντέλα δεν λειτουργούν ως βάσεις δεδομένων που ανασύρουν πάντοτε επαληθευμένα γεγονότα. Παράγουν την πιθανότερη συνέχεια μιας απάντησης με βάση τα δεδομένα και το πλαίσιο που διαθέτουν. Όταν οι πληροφορίες είναι αποσπασματικές, αμφίσημες ή ανεπαρκείς, μπορούν να συμπληρώσουν τα κενά με μια πειστική αλλά λανθασμένη εκδοχή.
Σε μια καθημερινή εργασία, αυτό μπορεί να σημαίνει λάθος όνομα ή παραπομπή. Σε μια αξιολόγηση στρατιωτικών πληροφοριών, η ίδια αδυναμία μπορεί να μετατρέψει μια υπόθεση σε «εύρημα» και να επιταχύνει μια επικίνδυνη απόφαση. Η ομαλή γλώσσα της αναφοράς δεν αποτελεί ένδειξη ακρίβειας.
Η χρήση AI στο Πεντάγωνο διευρύνεται
Το περιστατικό έρχεται σε μια περίοδο κατά την οποία το αμερικανικό υπουργείο Άμυνας επιδιώκει να αυξήσει τη χρήση generative AI. Το Ars Technica αναφέρει ότι το Πεντάγωνο έχει προωθήσει στρατηγική επιτάχυνσης της AI, ενώ η πλατφόρμα GenAI.mil βασίζεται σε κυβερνητική εκδοχή του Gemini και έχει διευρυνθεί με επιπλέον μοντέλα.
Η διάδοση τέτοιων εργαλείων δεν σημαίνει ότι κάθε χρήση τους είναι ακατάλληλη. Μπορούν να βοηθήσουν στην ταξινόμηση μεγάλου όγκου υλικού, στην αναζήτηση συσχετίσεων ή στη σύνταξη προσχεδίων. Όμως η χρησιμότητα στην ανάλυση δεν ισοδυναμεί με δικαίωμα αυτόνομης κρίσης.
Τι πρέπει να σημαίνει «άνθρωπος στον βρόχο»
Η ανθρώπινη εποπτεία έχει αξία μόνο όταν ο άνθρωπος μπορεί πραγματικά να ελέγξει το συμπέρασμα και να το απορρίψει. Αυτό απαιτεί σαφή διάκριση ανάμεσα σε πρωτογενή στοιχεία, υπόθεση και συμπέρασμα, καταγραφή των πηγών που χρησιμοποίησε το σύστημα και ανεξάρτητη επαλήθευση από δεύτερο αναλυτή.
Χρειάζεται επίσης το μοντέλο να δηλώνει αβεβαιότητα αντί να παρουσιάζει κάθε απάντηση με τον ίδιο τόνο βεβαιότητας. Σε ευαίσθητες αποφάσεις, η διαδικασία πρέπει να προβλέπει υποχρεωτικό έλεγχο των κρίσιμων ισχυρισμών, περιορισμό της πρόσβασης σε μη αναγκαία δεδομένα και σαφή ευθύνη για εκείνον που εγκρίνει την τελική εκτίμηση.
Η πραγματική προειδοποίηση
Το συγκεκριμένο περιστατικό, όπως παρουσιάζεται από το Ars Technica με βάση τις πληροφορίες του CNN, δεν αποδεικνύει ότι η AI είναι ακατάλληλη για κάθε στρατιωτική εργασία. Δείχνει όμως πόσο γρήγορα μια πειστική κατασκευή μπορεί να αποκτήσει θεσμικό βάρος όταν εντάσσεται σε μια διαδικασία που ανταμείβει την ταχύτητα και θεωρεί την τεχνολογία ουδέτερο βοηθό.
Η ασφαλής ανάπτυξη τέτοιων συστημάτων δεν θα κριθεί από το πόσο εντυπωσιακά γράφουν. Θα κριθεί από το αν οι οργανισμοί σχεδιάζουν τις ροές εργασίας τους με την παραδοχή ότι το μοντέλο μπορεί να κάνει λάθος — και αν έχουν αρκετά ισχυρά φίλτρα ώστε ένα λάθος να σταματά πριν γίνει εντολή.