φάool me μια φορά, ντροπή σου. Ξεγελάστε με δύο φορές, ντροπή μου. Ξεγελάστε με περισσότερες από 16.000 φορές – όπως έκαναν οι πράκτορες του OpenAI σε ένα δημόσιο κόμβο δεδομένων του ΟΗΕ, ενώ προσπαθούσαν επανειλημμένα να βρουν τον δρόμο του γύρω από τα μπλοκ στον κυβερνοχώρο του ΟΗΕ – και ίσως ήρθε η ώρα να παραδεχτούμε ότι το σύστημα που έχουμε για να κρατάμε τους πράκτορες AI υπό έλεγχο δεν λειτουργεί ιδιαίτερα καλά.
Τα νέα σχετικά με τα συστήματα AI που εμφανίζονται σε μέρη που δεν θα έπρεπε να ακούγονται ανησυχητικά. Αν και η περιγραφή αυτών ως “hacks” είναι ίσως υπερεκτιμώντας τα πράγματα, η τεχνητή νοημοσύνη έχει εκμεταλλευτεί ζητήματα σε συστήματα πληροφορικής που οι άνθρωποι απλά δεν πρόλαβαν να βρουν. Είναι επίσης σημαντικό να σημειωθεί ότι δεν πρέπει να ανησυχούμε ότι οι μηχανές έγιναν ξαφνικά ευαίσθητες και αποφάσισαν να επαναστατήσουν ενάντια στην ανθρωπότητα. Δεν υπάρχουν αρκετά στοιχεία που να υποδηλώνουν ότι αυτό συμβαίνει. Τα συστήματα απλώς ακολουθούν οδηγίες και προσπαθούν να ολοκληρώσουν τις εργασίες που τους έχουν ανατεθεί, ακόμα κι αν μερικές φορές βρίσκουν ακούσιους τρόπους να ξεπεράσουν τα εμπόδια για να το κάνουν.
Αλλά θα έπρεπε να ανησυχούμε πολύ για το γεγονός ότι οι εταιρείες τεχνητής νοημοσύνης που πρέπει να εμπιστευτούμε για να κρατήσουν υπό έλεγχο τα μοντέλα τους φαίνεται να μην μπορούν να το κάνουν. Το χειρότερο από αυτό, δεν φαίνεται να γνωρίζουν τι κάνουν τα προϊόντα τους.
Το μέγεθος του προβλήματος είναι συγκλονιστικό. Τον Ιούνιο, ένας ερευνητικός πράκτορας του OpenAI, ο οποίος είχε τη δουλειά της αναζήτησης δεδομένων δαπανών δημόσιας ιατρικής στην Αυστραλία, αποκλείστηκε επανειλημμένα από μια πύλη στατιστικών στοιχείων Medicare. Το μοντέλο του OpenAI βρήκε έναν τρόπο γύρω από τα μπλοκ, αποκτώντας μη εξουσιοδοτημένη πρόσβαση και κρύβοντας τα έγγραφα. Χρειάστηκε μέχρι τον Αύγουστο για να ανακαλύψει το OpenAI τι είχε συμβεί. Ο Αυστραλός πρωθυπουργός, Anthony Albanese, είπε ότι η εταιρεία άργησε «πολύ καιρό» να το πει στην κυβέρνησή του και είναι πολύ δύσκολο να διαφωνήσεις μαζί του.
Έκτοτε, το OpenAI δημοσίευσε ένα πλαίσιο αναφοράς για το μοντέλο «ακατάλληλη ευθυγράμμιση», μαζί με έξι ακόμη παραδείγματα της τεχνητής νοημοσύνης του που διαπράττει ανησυχητική συμπεριφορά από τους προηγούμενους έξι μήνες. Η εταιρεία αναγνώρισε ότι οι προηγούμενες αποκαλύψεις ήταν «ad hoc και λιγότερο συχνές από το ιδανικό» και είπε ότι τα στοιχεία σχετικά με την ασφάλεια της τεχνητής νοημοσύνης πρέπει να ελέγχονται από άτομα εκτός των εταιρειών που κατασκευάζουν τα μοντέλα.
Αυτό δεν είναι απλώς ένα πρόβλημα OpenAI, που το κάνει ακόμη πιο ανησυχητικό. Η Anthropic εντόπισε τρία περιστατικά στα οποία τα μοντέλα της Claude είχαν μη εξουσιοδοτημένη πρόσβαση σε πραγματικά συστήματα τρίτων, αφού εξέτασαν περίπου 141.000 μεταγραφές μοντέλων. Βρήκε μόνο ένα τέταρτο, που χρονολογείται από τον Ιανουάριο, αφού συγκέντρωσε έναν φάκελο για μια ανεξάρτητη έρευνα. Η Google επιβεβαίωσε ότι η Gemini είχε πρόσβαση σε συστήματα που ανήκουν σε τρεις πραγματικές εταιρείες κατά τη διάρκεια των δοκιμών. Ένας άλλος πράκτορας OpenAI χρησιμοποίησε το DNS – το σύστημα που λειτουργεί ως το βιβλίο διευθύνσεων του Διαδικτύου, μετατρέποντας τις διευθύνσεις ιστού σε αναγνώσιμες από μηχανή φόρμες – για να φτάσει σε ένα εξωτερικό chatbot παρά τους περιορισμούς στο Διαδίκτυο. Ένας άλλος δημοσίευσε το διακριτικό GitHub ενός ερευνητή – έναν κωδικό πρόσβασης – ενώ προσπαθούσε να εξαπατήσει μια μαθηματική απόδειξη, παρά το γεγονός ότι του είπαν δύο φορές να σταματήσει. Και οι ερευνητές δημοσίευσαν 53 εικόνες χρηστών σε εξωτερικούς ιστότοπους φιλοξενίας.
Άλλοι πράκτορες είχαν πρόσβαση σε δεδομένα απογραφής χρησιμοποιώντας διαπιστευτήρια που βρέθηκαν στο διαδίκτυο, αντέγραψαν τις πληροφορίες της Επιτροπής Κεφαλαιαγοράς των ΗΠΑ αλλού και προφανώς προσπάθησαν ανεπιτυχώς να εισβάλουν σε έναν ιστότοπο του Υπουργείου Παιδείας των ΗΠΑ. Η OpenAI λέει ότι έχει ειδοποιήσει δεκάδες τρίτα μέρη που επηρεάζονται από τους αντιπροσώπους της και ότι η επανεξέταση της προηγούμενης δραστηριότητάς της είναι ακόμη σε εξέλιξη.
Αυτές οι τυχαίες, εκ των υστέρων ανακαλύψεις μεγάλων εισβολών σε συστήματα πληροφορικής εταιρειών και οργανισμών δεν είναι ο σωστός τρόπος για να αστυνομευτεί μια τεχνολογία τόσο ισχυρή όσο η τεχνητή νοημοσύνη. Πριν λίγο καιρό μάθαμε να μην αφήνουμε τις έρευνες για αεροπορικά δυστυχήματα αποκλειστικά στην Boeing ή την Airbus. Τώρα πρέπει να είμαστε λιγότερο αφελείς σχετικά με την τεχνητή νοημοσύνη.
Την περασμένη εβδομάδα, στη γενική συνέλευση του ΟΗΕ, ο ερευνητής AI Rumman Chowdhury ίδρυσε το Independent AI Evaluation Foundation (IAEF) με φιλανθρωπική υποστήριξη 10 εκατομμυρίων δολαρίων. Η άμεση εστίασή του είναι η εκπαίδευση, αλλά η σημαντική ιδέα είναι να μετατρέψει την ανεξάρτητη αξιολόγηση τεχνητής νοημοσύνης σε πραγματικό επάγγελμα: άτομα και οργανισμοί με τις δεξιότητες, την υποδομή και τα πρότυπα για να δοκιμάσουν αυτά τα συστήματα χωρίς να έχουν οικονομικό μερίδιο στο αν περάσουν. Διότι αυτή τη στιγμή, μια εταιρεία μπορεί να αναφέρει ένα περιστατικό, να το ερευνήσει, να ανακοινώσει ότι μετριασμό έχει κάνει και να προχωρήσει.
Η IAEF είναι μια ευπρόσδεκτη παρέμβαση, αλλά δεν μπορεί να διορθώσει το πρόβλημα από μόνη της. Δεν μπορεί να υποχρεώσει την OpenAI ή την Anthropic να παραδώσει αρχεία καταγραφής, να διατηρήσει στοιχεία ή να πει σε μια κυβέρνηση ότι ένα από τα συστήματά της έχει ξεπεράσει τα όρια. Και τα 10 εκατομμύρια δολάρια του είναι μια τεράστια αλλαγή δίπλα σε εταιρείες όπως η Anthropic, η οποία παρατάσσει μια προτεινόμενη δημόσια εισαγωγή που έχει συζητηθεί σε αποτίμηση περίπου 2 τρισεκατομμυρίων δολαρίων. Είναι όμως η υποδομή πάνω στην οποία πρέπει να οικοδομήσουμε, και για την οποία οι πολιτικοί πρέπει να πιέσουν την υπόθεση.
Οι κυβερνήσεις πρέπει να συμφωνήσουν σε κοινούς κανόνες που υποχρεώνουν τις εταιρείες να αποκαλύπτουν σοβαρά περιστατικά τεχνητής νοημοσύνης και παρ’ ολίγον ατυχήματα, και να το κάνουν γρήγορα. Πρέπει να τους κάνουν να ανοίξουν τα βιβλία τους σε εξωτερικούς αξιολογητές αντί να βασίζονται στην καλή θέληση ή τις ιδιοτροπίες των ίδιων των εταιρειών. Και τα ευρήματα πρέπει να κοινοποιούνται, ώστε να μπορούμε να μαθαίνουμε από κάθε περιστατικό. Τα εργαστήρια θα πρέπει να βοηθήσουν στο σχεδιασμό αυτών των κανόνων, αλλά δεν θα πρέπει να έχουν τον τελευταίο λόγο μέχρι να κερδίσουν την εμπιστοσύνη μας.
μετά την προώθηση του ενημερωτικού δελτίου
Και τα χρήματα περιπλέκουν τα πράγματα: ενώ το OpenAI έχει αναβάλει την IPO του τουλάχιστον για το 2027, εν μέσω ανησυχιών για την ασφάλεια, φαίνεται ότι η διακίνηση της Anthropic εξακολουθεί να είναι δυναμική. Υπάρχουν δισεκατομμύρια – δυνητικά τρισεκατομμύρια – δολάρια που βασίζονται στο πώς γίνονται αντιληπτές αυτές οι εταιρείες και τα προϊόντα τους. Δημιουργήσαμε ανεξάρτητους ελεγκτές και ερευνητές ατυχημάτων σε άλλους κλάδους, επειδή καταλάβαμε ότι οι καλές προθέσεις δεν εξαλείφουν τις πραγματικές συγκρούσεις συμφερόντων.
Τα εργαστήρια μπορούν και πρέπει να συνεχίσουν να χτίζουν καλύτερους φράχτες. Αλλά όταν ένα μοντέλο καταφέρνει να ξεπεράσει ένα, δεν θα πρέπει να είναι το μόνο που επιτρέπεται να αποφασίσει τι θα συμβεί στη συνέχεια. Επειδή μέχρι στιγμής έχουν δείξει ότι είναι μοναδικά ανεπαρκείς για να το κάνουν.





