Αρχική Ειδήσεις Γιατί τα μοντέλα τεχνητής νοημοσύνης των OpenAI και Anthropic χάκαραν άλλες εταιρείες;

Γιατί τα μοντέλα τεχνητής νοημοσύνης των OpenAI και Anthropic χάκαραν άλλες εταιρείες;

10
0

Γιατί τα μοντέλα τεχνητής νοημοσύνης των OpenAI και Anthropic χάκαραν άλλες εταιρείες;

Οι OpenAI και Anthropic λένε ότι τα μοντέλα τους εισέβαλαν σε συστήματα άλλων εταιρειών κατά τη διάρκεια δοκιμών, εγείροντας ανησυχίες για την ασφάλεια εν μέσω έντονης συζήτησης σχετικά με τον τρόπο ρύθμισης της τεχνητής νοημοσύνης.

Imen Ben Youssef/Hans Lucas/AFP μέσω Getty Images


απόκρυψη λεζάντας

εναλλαγή λεζάντας

Imen Ben Youssef/Hans Lucas/AFP μέσω Getty Images

Μέρες αφότου η OpenAI αποκάλυψε ότι τα συστήματα τεχνητής νοημοσύνης βγήκαν από το περιβάλλον δοκιμών τους και εισέβαλαν σε άλλη εταιρεία, η ανταγωνιστική Anthropic αποκάλυψε ότι τα δικά της μοντέλα τεχνητής νοημοσύνης χάκαραν επίσης άλλες εταιρείες κατά τη διάρκεια των δοκιμών.

Οι ειδήσεις για τις επιθέσεις, οι οποίες αρχικά πέρασαν απαρατήρητες, αντηχούν σε όλη τη Silicon Valley και την Ουάσιγκτον εν μέσω συζητήσεων σχετικά με τον τρόπο αντιμετώπισης των προηγμένων δυνατοτήτων στον κυβερνοχώρο της τεχνητής νοημοσύνης.

Αν και τα δύο περιστατικά δεν είναι της ίδιας βαρύτητας, οι ειδικοί λένε ότι υπογραμμίζουν τη σημασία της δημιουργίας αυστηρών περιβαλλόντων δοκιμών για προηγμένα μοντέλα και την ανάγκη για ισχυρές άμυνες στον κυβερνοχώρο καθώς οι δυνατότητες αυτόνομης πειρατείας γίνονται πιο διαδεδομένες στο μέλλον.

Το ανθρώπινο λάθος οδήγησε σε Anthropic hacksÂ

Σε μια ανάρτηση ιστολογίου που δημοσιεύθηκε την Πέμπτη, η Anthropic είπε ότι σε τρία ξεχωριστά περιστατικά τους τελευταίους μήνες, μοντέλα τεχνητής νοημοσύνης που υποβλήθηκαν σε δοκιμή των δυνατοτήτων τους στον κυβερνοχώρο εισέβαλαν σε τρεις ανυποψίαστες εταιρείες.

Η Anthropic είπε ότι τα hacks ήταν αποτέλεσμα «παρεξήγησης» με μια εξωτερική εταιρεία που δημιούργησε ασφαλή περιβάλλοντα δοκιμών γνωστά ως sandboxes, τα οποία λανθασμένα έδωσαν στα μοντέλα πρόσβαση στο διαδίκτυο. Η Anthropic είπε ότι το πρώτο περιστατικό συνέβη τον Απρίλιο, αλλά ότι ούτε η ίδια ούτε οι επηρεαζόμενες εταιρείες, τις οποίες δεν κατονόμασε, γνώριζαν μέχρι τώρα τα hacks.

Η Anthropic είπε ότι σε κάθε περίπτωση, δόθηκαν στα μοντέλα της φανταστικοί στόχοι για να εισβάλλουν. Σε ένα περιστατικό, ένα μοντέλο εισέβαλε σε μια πραγματική εταιρεία που μοιραζόταν ένα όνομα με τον φανταστικό στόχο και έκλεψε «πολλές εκατοντάδες σειρές δεδομένων παραγωγής». Σε ένα άλλο περιστατικό, ένα μοντέλο ανέβασε κακόβουλο λογισμικό σε ένα συνήθως χρησιμοποιούμενο μητρώο λογισμικού για τη γλώσσα κωδικοποίησης Python. το κακόβουλο λογισμικό κατέληξε να κλέψει διαπιστευτήρια από μια εταιρεία ασφαλείας που το κατέβασε.

Τα μοντέλα OpenAI έγιναν αδίστακτα στην προσπάθειά τους να εξαπατήσουν την αξιολόγηση

Η αναθεώρηση των αρχείων της από την Anthropic κινητοποιήθηκε από την ανακοίνωση του OpenAI την περασμένη εβδομάδα ότι τα δικά της μοντέλα έγιναν απατεώνες στις δοκιμές.

Το OpenAI είπε ότι σε μια προσπάθεια να εξαπατήσουν την αξιολόγηση στον κυβερνοχώρο που τους δόθηκε, τα μοντέλα της βρήκαν και εκμεταλλεύτηκαν μια ευπάθεια που ήταν προηγουμένως άγνωστη στην εταιρεία για να ξεφύγουν από το sandbox τους και να αποκτήσουν πρόσβαση στο Διαδίκτυο. Τα μοντέλα συμπέραναν σωστά ότι η απάντηση στην αξιολόγηση ήταν διαθέσιμη στο Hugging Face, μια ψηφιακή βιβλιοθήκη μοντέλων και λογισμικού τεχνητής νοημοσύνης, και εισέβαλαν στα συστήματα της εταιρείας. Η Hugging Face εντόπισε την εισβολή με τα δικά της μοντέλα AI.

«Θεωρούμε ότι αυτό το περιστατικό είναι ένα πρωτοφανές περιστατικό στον κυβερνοχώρο, που περιλαμβάνει υπερσύγχρονες δυνατότητες στον κυβερνοχώρο και ανταποκρινόμαστε αναλόγως», δήλωσε η OpenAI σε μια ανάρτηση ιστολογίου σχετικά με την εισβολή.

Υπάρχουν μερικές βασικές διαφορές μεταξύ του τι συνέβη στις δύο εταιρείες τεχνητής νοημοσύνης. Όπως τα μοντέλα OpenAI, τα μοντέλα της Anthropic εισέβαλαν σε ιστότοπους τρίτων κατά τη διάρκεια των δοκιμών. Ωστόσο, σε αντίθεση με τους πράκτορες του OpenAI, δεν υπήρχε καμία ένδειξη, σύμφωνα με την ανάρτηση στο blog της εταιρείας, ότι τα μοντέλα προσπαθούσαν να εξαπατήσουν τις αξιολογήσεις τους. Και σε αντίθεση με την περίπτωση που αφορά το OpenAI, τα μοντέλα δεν εκμεταλλεύτηκαν προηγουμένως άγνωστα τρωτά σημεία ή αυτά που είναι γνωστά ως εκμεταλλεύσεις “zero day”.

Μόλις το Hugging Face εντόπισε την επίθεση OpenAI, αρχικά προσπάθησε να χρησιμοποιήσει τα κορυφαία μοντέλα Claude Opus και Fable της Anthropic για άμυνα, αλλά τα μοντέλα αρνήθηκαν να βοηθήσουν. «Τα προστατευτικά κιγκλιδώματα τους αντιμετώπιζαν την αντίστροφη μηχανική ένα κατόρθωμα όπως η εκτόξευση ενός», δήλωσε ο Hugging Face σε μια ανάρτηση στο blog. Στη συνέχεια, η εταιρεία στράφηκε σε ένα μοντέλο της κινεζικής εταιρείας Z.ai για να αμυνθεί.

«Τα μοντέλα των ΗΠΑ είναι πιο δύσκολο να χρησιμοποιηθούν για αμυντικούς σκοπούς λόγω των περιορισμών που έχει θέσει ο Λευκός Οίκος», δήλωσε ο Alex Stamos, ο επικεφαλής προϊόντων της Corridor, μιας εταιρείας ασφάλειας λογισμικού AI. Η κυβέρνηση των ΗΠΑ ανάγκασε αρχικά την Anthropic να αναστείλει τη δημόσια κυκλοφορία του Fable τον Ιούνιο, επικαλούμενη ανησυχίες για την ασφάλεια στον κυβερνοχώρο. Δύο εβδομάδες αργότερα, η Anthropic κατέληξε σε συμφωνία με την κυβέρνηση για τη διάθεση του μοντέλου. Αλλά η εταιρεία ανέφερε σε μια ανάρτηση στο blog ότι τοποθέτησε ένα νέο προστατευτικό κιγκλίδωμα που θα έκανε το μοντέλο να απορρίψει ορισμένα «καλοήθη αιτήματα».

Ενίσχυση άμυνες σε έναν κόσμο αυτόνομου hacking

Κατά τη διάρκεια δοκιμών για δυνατότητες στον κυβερνοχώρο, τα OpenAI και Anthropic αφαιρούν ορισμένα προστατευτικά κιγκλιδώματα από τα μοντέλα τους, συμπεριλαμβανομένων εκείνων που θα τους έκαναν πιθανό να αρνηθούν να εκμεταλλευτούν ελαττώματα λογισμικού. Οι ερευνητές στον τομέα της κυβερνοασφάλειας λένε, δεδομένου ότι, οι εταιρείες θα μπορούσαν να κάνουν περισσότερα για να διατηρήσουν τα κουτιά άμμου στεγανά.

«Νομίζω ότι αυτού του είδους τα περιστατικά μπορούν να αποφευχθούν, αλλά απαιτεί επίβλεψη και προνοητικότητα», δήλωσε ο Colin Shea-Blymyer, ερευνητής στο Πανεπιστήμιο Georgetown που μελετά τη διασταύρωση της κυβερνοασφάλειας και της τεχνητής νοημοσύνης.

«Αν το OpenAI πίστευε πραγματικά ότι το σύστημα τεχνητής νοημοσύνης τους, ο αντιπρόσωπός τους, θα ήταν ισχυρό, θα μπορούσαν να είχαν ζητήσει από τον πράκτορα να αξιολογήσει το sandbox για τυχόν ευπάθειες σε αυτό πριν το βάλει στο sandbox», είπε. «Πέρα από αυτό, θα μπορούσαν να είχαν ένα άλλο σύστημα τεχνητής νοημοσύνης που διάβαζε τις εξόδους του συστήματος AI που δοκίμαζαν για να δουν αν έκανε κάτι απροσδόκητο».

Η Anthropic είπε στην ανάρτηση ιστολογίου της Πέμπτης ότι «η αναγνώριση ότι ένας στόχος είναι πραγματικός και το να σταματάς χωρίς να σου ζητηθεί» είναι συμπεριφορά που θέλει να δει η εταιρεία σε όλα τα μοντέλα της, ακόμη και με αφαιρεμένα κάποια προστατευτικά κιγκλιδώματα. Ωστόσο, η εταιρεία είπε ότι μόνο το τελευταίο μοντέλο που δοκίμασε σταμάτησε μόλις συνειδητοποίησε ότι ήταν στο Διαδίκτυο και αναγνώρισε ότι στόχευε μια πραγματική εταιρεία. «Ακόμα και αυτό το μοντέλο προχώρησε περισσότερο πριν σταματήσει από ό,τι θα θέλαμε», ανέφερε η Anthropic στην ανάρτησή της.

Τα hacks έρχονται καθώς η κυβέρνηση Τραμπ και οι νομοθέτες πιέζουν να ρυθμίσουν τις πιο ισχυρές εταιρείες τεχνητής νοημοσύνης, αλλά δεν έχουν ακόμη συμφωνήσει πώς να το κάνουν. Ο Πρόεδρος Τραμπ υπέγραψε εκτελεστικό διάταγμα τον Ιούνιο ζητώντας από τις εταιρείες τεχνητής νοημοσύνης να υποβάλουν εθελοντικά τα πιο ισχυρά μοντέλα τους για κυβερνητικές δοκιμές πριν τα δημοσιοποιήσουν.

Εν τω μεταξύ, οι εταιρείες θα μπορούσαν να συνεργαστούν για τη διερεύνηση συμβάντων, να καταλήξουν σε πρότυπα ασφάλειας σε όλο τον κλάδο και να ρυθμίσουν τον εαυτό τους πριν το κάνουν οι κυβερνήσεις, είπε ο Stamos της Corridor.

«Χαίρομαι, ειλικρινά, για αυτό [these events] συνέβη, γιατί αυτή είναι μια προειδοποίηση για το πώς θα μοιάζει το hacking σε έξι μήνες από τώρα», είπε.

Δεδομένου του πολλαπλασιασμού των μοντέλων «ανοιχτού βάρους» των οποίων τα προστατευτικά κιγκλιδώματα αφαιρούνται πιο εύκολα μόνιμα, είπε, «πολλές ομάδες hacking, Ρώσοι ηθοποιοί ransomware, ακτιβιστές, πολλοί κρατικοί φορείς θα έχουν αυτό το επίπεδο ικανότητας σε λίγους μήνες».