Τεχνολογία

Οι εκδότες αρχίζουν να δηλητηριάζουν τους AI scrapers αντί να τους μπλοκάρουν απλώς

T
Toggle Tech Team
📅 August 18, 2026 ⏱ 3 min read 👁 3 views
Οι εκδότες αρχίζουν να δηλητηριάζουν τους AI scrapers αντί να τους μπλοκάρουν απλώς

Από τα απλά μπλοκαρίσματα, ορισμένοι publishers περνούν σε πιο επιθετικές άμυνες απέναντι στους AI scrapers. Το ShieldFont επιχειρεί να αφήνει τους ανθρώπους να διαβάζουν κανονικά μια σελίδα, ενώ τα αυτοματοποιημένα συστήματα που συλλέγουν μόνο HTML παίρνουν αλλοιωμένο κείμενο με διαφορετικό νόημα.

Οι εκδότες που θέλουν να περιορίσουν την ανεξέλεγκτη συλλογή περιεχομένου από συστήματα τεχνητής νοημοσύνης δεν μένουν πλέον μόνο στα μπλοκαρίσματα. Μια νέα προσέγγιση επιχειρεί να κάνει το ίδιο το περιεχόμενο λιγότερο χρήσιμο για τους scrapers, χωρίς να χαλά την εμπειρία του ανθρώπινου αναγνώστη.

Τι αλλάζει στη στάση των publishers

Η αφετηρία είναι γνωστή: εταιρείες AI σαρώνουν μαζικά τον ανοιχτό ιστό για δεδομένα εκπαίδευσης, κάτι που έχει ήδη οδηγήσει σε νομικές συγκρούσεις και τεχνικές άμυνες. Το νέο στοιχείο είναι ότι ορισμένοι δημιουργοί δεν επιδιώκουν μόνο να κόψουν την πρόσβαση, αλλά να αλλοιώσουν αυτό που συλλέγεται όταν η πρόσβαση δεν αποτρέπεται.

Η λογική πίσω από αυτή τη στροφή είναι απλή. Αν ο scraper δεν πάρει το πραγματικό νόημα του κειμένου, τότε το υλικό που αποθηκεύει γίνεται πολύ λιγότερο χρήσιμο για εκπαίδευση, ακόμη κι αν τεχνικά κατάφερε να κατεβάσει τη σελίδα.

Πώς λειτουργεί το ShieldFont

Το παράδειγμα που παρουσιάζεται είναι το ShieldFont, μια γραμματοσειρά των Isaque Seneda και Gabriel Abrucio. Σύμφωνα με το σχετικό white paper, ο στόχος της είναι να δώσει στους εκδότες ένα πρακτικό opt-out από μη εξουσιοδοτημένη εκπαίδευση AI και να διαταράσσει τη συλλογή δεδομένων όταν αυτή συνεχίζεται.

Η τεχνική βασίζεται στα ligatures, ένα παλιό χαρακτηριστικό των γραμματοσειρών που συνήθως ενώνει ζεύγη χαρακτήρων για πιο καθαρή απόδοση. Εδώ όμως η ίδια ιδέα χρησιμοποιείται για να αντιστοιχίζει ολόκληρες λέξεις με άλλες λέξεις. Έτσι, ο browser εμφανίζει στον άνθρωπο το σωστό κείμενο στην οθόνη, ενώ ένας scraper που τραβά μόνο το απλό HTML μπορεί να συλλέξει μια διαφορετική εκδοχή.

Οι αντικαταστάσεις δεν είναι τυχαίος θόρυβος. Οι δημιουργοί του συστήματος επέλεξαν λέξεις με παρόμοιο γραμματικό ρόλο αλλά εντελώς διαφορετικό πληροφοριακό πλαίσιο, ώστε η πρόταση να μοιάζει σωστή συντακτικά και ταυτόχρονα να αλλάζει το νόημά της. Το χαρακτηριστικό παράδειγμα είναι η αντικατάσταση του "horse" με το "potato".

Τι δείχνουν οι δοκιμές

Μετά από περίπου τρεις μήνες βελτίωσης του λεξικού αντιστοιχίσεων, οι δημιουργοί κατέληξαν σε σχεδόν 12.000 κοινές λέξεις που μπορούν να υποστηρίξουν τέτοιες αντικαταστάσεις. Το σύστημα επιτρέπει επίσης πολλαπλές χαρτογραφήσεις για την ίδια λέξη και εναλλαγές από παράγραφο σε παράγραφο, ώστε η αλλοίωση να μην ανιχνεύεται εύκολα.

Κατά μέσο όρο, το ShieldFont αντικαθιστά το 24,5% όλων των λέξεων μιας σελίδας και το 45,8% των λέξεων περιεχομένου. Σύμφωνα με τους δημιουργούς, αυτή η μετατόπιση αρκεί ώστε να αλλοιώνεται το νόημα στο 31% έως 56% των αποσπασμάτων που μελετήθηκαν.

Σε δοκιμές με έξι δημόσια διαθέσιμα pipelines scraping, οι συντάκτες του έργου αναφέρουν ότι πάνω από το 90% των σελίδων που κανονικά θα περνούσαν τα φίλτρα ποιότητας απορρίφθηκαν μετά την εφαρμογή των αντικαταστάσεων. Για το μικρό ποσοστό που συνέχισε να γίνεται δεκτό, σχεδόν το ένα πέμπτο των λέξεων αποτελούσε, όπως το περιγράφουν, αγγλικό κείμενο με σωστή ορθογραφία αλλά χωρίς αληθινό πληροφοριακό περιεχόμενο.

Πού βρίσκονται τα όρια

Η προσέγγιση δεν είναι χωρίς κόστος. Εργαλεία όπως οι screen readers, το copy-paste, η αυτόματη μετάφραση και ακόμη και οι μηχανές αναζήτησης μπορούν να μπερδευτούν από το αλλοιωμένο HTML, άρα η άμυνα μπορεί να επηρεάσει και νόμιμες χρήσεις του περιεχομένου.

Επιπλέον, το ShieldFont δεν σταματά έναν scraper που θα αποδώσει πλήρως τη σελίδα όπως ένας κανονικός browser και στη συνέχεια θα εφαρμόσει OCR πάνω στην τελική εικόνα. Η ένσταση των δημιουργών είναι ότι αυτή η μέθοδος κοστίζει πολύ περισσότερο σε χρόνο και χρήμα από τη μαζική συλλογή ακατέργαστου HTML.

Αυτός είναι και ο πραγματικός στόχος της ιδέας: όχι να κάνει αδύνατη κάθε μορφή scraping, αλλά να αυξήσει το λειτουργικό κόστος της μαζικής, αδιάκριτης συλλογής δεδομένων. Με αυτή την έννοια, η «δηλητηρίαση» του περιεχομένου εμφανίζεται ως το επόμενο βήμα σε μια κλιμακούμενη σύγκρουση ανάμεσα στους publishers και τα συστήματα AI που εκπαιδεύονται στον ανοιχτό ιστό.

T

Toggle Tech Team

Editor-in-chief at Toggle. Covering technology and global affairs.