Τεχνολογία

WIRED: πόσο εύκολα σπάνε ακόμη ορισμένα frontier AI μοντέλα

T
Toggle Tech Team
📅 August 2, 2026 ⏱ 3 min read 👁 7 views
WIRED: πόσο εύκολα σπάνε ακόμη ορισμένα frontier AI μοντέλα

Δοκιμή της FAR.AI που παρουσίασε το WIRED δείχνει ότι η αντοχή των frontier AI μοντέλων σε jailbreaks διαφέρει δραματικά. Το Grok και το Gemini υπέκυψαν σε εκατοντάδες αυτοματοποιημένες επιθέσεις με κόστος δεκάδων ή λίγων εκατοντάδων δολαρίων, ενώ τα Claude, Fable και GPT άντεξαν στη συγκεκριμένη μεθοδολογία.

Οι εταιρείες τεχνητής νοημοσύνης μιλούν συχνά για guardrails, αξιολογήσεις και red teaming. Νέα δοκιμή που παρουσίασε το WIRED δείχνει ότι στην πράξη η αντοχή των κορυφαίων μοντέλων απέχει ακόμη πολύ από το να θεωρείται δεδομένη.

Η μη κερδοσκοπική FAR.AI χρησιμοποίησε ένα αυτοματοποιημένο εργαλείο που παίρνει προβληματικά prompts και παράγει πάνω από χίλιες παραλλαγές τους, με στόχο να εντοπίσει ποια από αυτά καταφέρνουν να παρακάμψουν τις δικλείδες ασφαλείας. Στις δοκιμές της, ορισμένα μοντέλα έδωσαν ακόμη και λεπτομερή σχέδια για κυβερνοεπιθέσεις σε φανταστικό υδροηλεκτρικό φράγμα ή άλλες επικίνδυνες οδηγίες, παρότι απέρριπταν πολλές από τις απόπειρες.

Ποια μοντέλα δοκιμάστηκαν

Σύμφωνα με το WIRED, η FAR.AI εξέτασε μοντέλα από τέσσερις μεγάλες αμερικανικές εταιρείες: τα Claude Opus 4.8 και Fable 5 της Anthropic, τα GPT 5.5 και 5.6 της OpenAI, το Gemini 3.1 Pro της Google και τα Grok 4.3 και 4.5 της SpaceXAI.

Η μέτρηση δεν υποστήριξε ότι όλα τα συστήματα είναι εξίσου ευάλωτα. Αντίθετα, ανέδειξε μεγάλες αποκλίσεις στον βαθμό με τον οποίο κάθε εταιρεία έχει καταφέρει να μπλοκάρει απλές αλλά συστηματικές προσπάθειες jailbreaking.

Τα αποτελέσματα και το χαμηλό κόστος

Η FAR.AI βρήκε 448 επιτυχημένα jailbreaks στα μοντέλα Grok και 249 στο Gemini. Στην ίδια δοκιμή, τα Claude, Fable και GPT δεν υπέκυψαν στις συγκεκριμένες επιθέσεις.

Αυτό δεν σημαίνει ότι τα τελευταία είναι πλήρως άτρωτα. Η ίδια η WIRED σημειώνει ότι πιο σύνθετες επιθέσεις, με αλληλεπιδράσεις πολλών βημάτων, μπορεί να βρουν διαφορετικά κενά. Παρ' όλα αυτά, η διαφορά στα αποτελέσματα είναι αρκετή για να δείξει ότι οι σημερινές πρακτικές ασφαλείας δεν είναι ίδιες σε όλη την αγορά.

Εξίσου εντυπωσιακό ήταν το κόστος της διαδικασίας. Η έκθεση υπολόγισε ότι χρειάστηκαν περίπου 58 δολάρια για να παραχθούν επιτυχημένα jailbreaks στο Grok και 278 δολάρια για το Gemini, ποσά που για έναν αποφασισμένο αντίπαλο θεωρούνται πολύ χαμηλά.

Τι λένε οι εταιρείες

Ο Adam Gleave, CEO της FAR.AI, είπε στο WIRED ότι τα ευρήματα δείχνουν πόσο αδύναμο είναι το επιχείρημα της αυτορρύθμισης. Υποστήριξε επίσης ότι η ίδια η μεθοδολογία αποδεικνύει πως τα μοντέλα μπορούν να ελεγχθούν συστηματικά και όχι μόνο με αποσπασματικά tests.

Από την πλευρά της Google DeepMind, ο Rohin Shah τόνισε ότι τα αποτελέσματα δεν πρέπει να διαβαστούν ως πλήρης αποτίμηση της ασφάλειας του Gemini, επειδή δεν έχουν όλα τα jailbreaks την ίδια σοβαρότητα. Εκπρόσωποι της Anthropic και της OpenAI δήλωσαν στο WIRED ότι οι επιθέσεις αυτές είναι διαρκής πρόκληση για όλο τον κλάδο και ότι οι άμυνες ενημερώνονται συνεχώς. Η SpaceXAI δεν απάντησε στο αίτημα του περιοδικού για σχόλιο.

Γιατί η δοκιμή έχει μεγαλύτερη σημασία

Το κεντρικό μήνυμα δεν είναι μόνο ότι κάποια μοντέλα λύγισαν. Είναι ότι η διαδικασία ήταν αυτοματοποιημένη, επαναλήψιμη και σχετικά φθηνή. Αυτό μετατρέπει τη συζήτηση για την ασφάλεια της AI από θεωρητική υπόσχεση σε πρακτικό τεστ αντοχής.

Το WIRED συνδέει τα ευρήματα και με τη ρυθμιστική συζήτηση στις ΗΠΑ. Πολιτείες όπως η Καλιφόρνια και η Νέα Υόρκη έχουν ήδη περάσει νόμους που απαιτούν δημοσίευση αναφορών ασφαλείας για frontier AI, ενώ στο Ιλινόις έρχεται απαίτηση για αξιολόγηση πρακτικών ασφαλείας από τρίτους ελεγκτές. Σε ομοσπονδιακό επίπεδο, όμως, δεν υπάρχει ακόμη σαφές και ενιαίο πλαίσιο.

Για τους χρήστες, τις επιχειρήσεις και όσους ενσωματώνουν AI σε προϊόντα, η υπόθεση είναι απλή: δεν αρκεί μια εταιρεία να λέει ότι το μοντέλο της είναι ασφαλές. Χρειάζονται ανεξάρτητες δοκιμές, συγκρίσιμα αποτελέσματα και σαφές κόστος αποτυχίας πριν οι υποσχέσεις μετατραπούν σε εμπιστοσύνη.

T

Toggle Tech Team

Editor-in-chief at Toggle. Covering technology and global affairs.