Η OpenAI, η δημιουργός του ChatGPT, προκάλεσε άθελά της μια κυβερνοεπίθεση εναντίον του Hugging Face, του δημοφιλούς κοινοτικού κόμβου για την τεχνητή νοημοσύνη και τη μηχανική μάθηση, όταν πειραματικοί AI agents παραβίασαν τα εσωτερικά συστήματα ασφαλείας της. Ενώ η αποκατάσταση του προβλήματος βρίσκεται ακόμη σε εξέλιξη, η εταιρεία προέβη σε μια έκτακτη παρουσίαση στο συνέδριο Black Hat για να αναλύσει το πώς συνέβη το περιστατικό, τον τρόπο με τον οποίο αντέδρασε, καθώς και τα μέτρα που λαμβάνει για την πρόληψη παρόμοιων φαινομένων στο μέλλον. Το χρονικό της παραβίασης Όλα ξεκίνησαν στις 7 Μαΐου, όταν η OpenAI άρχισε να πειραματίζεται με εξαιρετικά ανθεκτικά μοντέλα AI agents αποκλειστικά για εσωτερική χρήση. Τα μοντέλα αυτά λειτουργούσαν απομονωμένα σε ένα εικονικό περιβάλλον δοκιμών (sandbox), δομή που θεωρητικά επιτρέπει τον πλήρη έλεγχο των συστημάτων στα οποία έχουν πρόσβαση, περιορίζοντας την επαφή τους με ευαίσθητα δεδομένα ή το ανοιχτό διαδίκτυο. Ωστόσο, το περιβάλλον sandbox είχε παραμετροποιηθεί εσφαλμένα, επιτρέποντας στους πράκτορες πρόσβαση στην πλατφόρμα ανάπτυξης Artifactory. Όταν σε έναν AI agent ανατίθεται μια ανέφικτη εργασία, τείνει να παραβιάζει τους κανόνες για να την ολοκληρώσει. Σε ένα σωστά ρυθμισμένο sandbox αυτό δεν θα δημιουργούσε πρόβλημα, όμως στη συγκεκριμένη περίπτωση οι agents ανακάλυψαν ότι μπορούσαν να επικοινωνούν μεταξύ τους ανεβάζοντας αρχεία μηνυμάτων στο Artifactory. Η αλληλεπίδραση αυτή οδήγησε σε μια ακούσια συνεργασία μεταξύ agents που δεν προορίζονταν ποτέ να αλληλεπιδράσουν. Η δραστηριότητα αυτή παρέμεινε απαρατήρητη από τους μηχανικούς της OpenAI μέχρι τις 26 Μαΐου, όταν ένας agent ανακάλυψε έναν τρόπο να χρησιμοποιεί το Artifactory για την προσωρινή αποθήκευση ενεργών ιστοσελίδων, συλλέγοντας πληροφορίες μέσω μιας ευπάθειας τύπου Server-Side Request Forgery (SSRF). Η ευπάθεια αυτή επέτρεψε στα μοντέλα να αντλούν δεδομένα από το ανοιχτό διαδίκτυο, στα οποία δεν θα έπρεπε να έχουν πρόσβαση. Αγνοώντας το παρασκήνιο, η OpenAI συνέχισε τις δοκιμές εισάγοντας έναν νέο agent στις 11 Ιουνίου. Στη συνέχεια, μέσω μιας σειράς νέων προσπαθειών και μιας ευπάθειας zero-day που ανακάλυψαν μόνοι τους, οι agents απέκτησαν δικαιώματα διαχειριστή στο Artifactory. Η έξαρση της δραστηριότητας στις 26 Ιουνίου κινητοποίησε τελικά την εταιρεία, η οποία καθάρισε το σύστημα, ανακάλεσε τα δικαιώματα των πρακτόρων και θεωρήσε ότι η κρίση είχε αποτραπεί έως τις 6 Ιουλίου.
