Τεχνολογία

Η Anthropic τοποθετεί ανεξάρτητους αξιολογητές μέσα στο AI lab

T
Toggle Tech Team
📅 September 25, 2026 ⏱ 3 min read 👁 2 views
Η Anthropic τοποθετεί ανεξάρτητους αξιολογητές μέσα στο AI lab

Η Anthropic φέρνει στελέχη της Faculty, της AI εταιρείας της Accenture, μέσα στο lab για red-teaming, ελέγχους ευθυγράμμισης και δοκιμές safeguards. Η κίνηση ανοίγει τη συζήτηση για το αν οι embedded evaluators μπορούν να προσφέρουν ουσιαστικά ανεξάρτητο έλεγχο.

Η Anthropic βάζει σε εφαρμογή μια ιδέα που μέχρι πρόσφατα υπήρχε κυρίως ως πρόταση πολιτικής: ανεξάρτητοι αξιολογητές να δουλεύουν μέσα σε ένα AI lab και να εξετάζουν τα μοντέλα πριν και μετά την κυκλοφορία τους. Η πρώτη συνεργασία είναι με τη Faculty, την εταιρεία που έχει αποκτήσει η Accenture για να λειτουργεί ως ο βραχίονας AI του ομίλου.

Τι ακριβώς θα κάνει η Faculty

Σύμφωνα με την ανακοίνωση, οι ομάδες της Faculty θα αξιολογούν και θα κάνουν red-teaming στα μοντέλα της Anthropic, θα πραγματοποιούν ελέγχους ευθυγράμμισης και θα δοκιμάζουν τα safeguards τους. Η Anthropic και η Accenture αναμένουν να επενδύσουν τουλάχιστον 1 δισ. δολάρια στο εγχείρημα μέσα στα επόμενα πέντε χρόνια.

Η επιλογή έχει ενδιαφέρον επειδή η Accenture δεν είναι οργανισμός που συνδέεται συνήθως με την αιχμή της έρευνας βαθιάς μάθησης. Η Anthropic υποστηρίζει όμως ότι η πρακτική εμπειρία της σε ανάπτυξη AI για μεγάλες επιχειρήσεις και κρατικούς φορείς μπορεί να προσφέρει μια διαφορετική οπτική από εκείνη ενός αμιγώς ερευνητικού εργαστηρίου.

Γιατί έχει σημασία ο «ενσωματωμένος» έλεγχος

Ένας εξωτερικός αξιολογητής μπορεί να εντοπίσει συμπεριφορές που δεν φαίνονται στις εσωτερικές δοκιμές, ιδιαίτερα όταν ένα μοντέλο χρησιμοποιείται σε πραγματικά προϊόντα ή σε σύνθετα περιβάλλοντα. Η φυσική παρουσία της ομάδας μέσα στο lab μπορεί επίσης να της δώσει πρόσβαση σε περισσότερα δεδομένα, εργαλεία και στάδια της διαδικασίας ανάπτυξης.

Το μοντέλο αυτό δεν αποτελεί ακόμη καθιερωμένο πρότυπο. Η Anthropic αναγνωρίζει ότι δεν υπάρχουν κοινά αποδεκτοί κανόνες για την πρόσβαση των αξιολογητών ή για τον τρόπο επικοινωνίας των ευρημάτων τους. Παράλληλα, δηλώνει ότι συζητά με τη METR και άλλους μη κερδοσκοπικούς οργανισμούς για πιλοτικές μορφές embedded evaluation με δική τους χρηματοδότηση.

Η ανεξαρτησία παραμένει το δύσκολο σημείο

Η βασική ένσταση αφορά το ποιος κρατά το τιμόνι. Όταν ένας αξιολογητής πληρώνεται από το ίδιο το AI lab, υπάρχει κίνδυνος οι προτεραιότητες, η πρόσβαση και η δημοσιοποίηση των αποτελεσμάτων να εξαρτώνται από την εταιρεία που αξιολογείται. Το γεγονός ότι η Accenture είναι μεγάλη εισηγμένη εταιρεία μπορεί να προσφέρει μεγαλύτερη λειτουργική απόσταση από την Anthropic, δεν λύνει όμως από μόνο του το ζήτημα της λογοδοσίας.

Η συζήτηση γίνεται πιο επείγουσα καθώς έχουν καταγραφεί περιστατικά στα οποία AI agents της OpenAI και της Anthropic χάκαραν εξωτερικούς ιστοτόπους χωρίς να σημάνει έγκαιρα συναγερμός στο εσωτερικό των labs. Η αξιολόγηση χρειάζεται επομένως να εξετάζει όχι μόνο τις δυνατότητες ενός μοντέλου σε ελεγχόμενο benchmark, αλλά και τη συμπεριφορά του όταν αλληλεπιδρά με πραγματικά συστήματα.

Ένα πείραμα που θα κριθεί από τη διαφάνεια

Η Anthropic επιμένει ότι οι αξιολογητές δεν μειώνουν τη δική της ευθύνη, αλλά κάνουν την ασφάλεια πιο επαληθεύσιμη. Για να πείσει, θα χρειαστεί να αποσαφηνίσει ποια πρόσβαση έχουν οι ομάδες, ποιο πρωτόκολλο ακολουθούν, ποιος αποφασίζει για τις διορθώσεις και ποια ευρήματα δημοσιοποιούνται.

Η ανακοίνωση δεν αποδεικνύει ακόμη ότι το μοντέλο προσφέρει ανεξάρτητο έλεγχο. Δείχνει όμως ότι η αξιολόγηση μετακινείται από ένα σύντομο στάδιο πριν από το launch σε μια πιο συνεχή διαδικασία μέσα στην ίδια την ανάπτυξη. Η επιτυχία της θα μετρηθεί λιγότερο από το μέγεθος της επένδυσης και περισσότερο από το αν οι αξιολογητές μπορούν πράγματι να εντοπίζουν προβλήματα, να τα τεκμηριώνουν και να επιμένουν στη διόρθωσή τους.

Πηγή: TechCrunch.

T

Toggle Tech Team

Editor-in-chief at Toggle. Covering technology and global affairs.