Ένα εσωτερικό μοντέλο της OpenAI, σχεδιασμένο να εκτελεί διεργασίες μεγάλης διάρκειας, τέθηκε προσωρινά εκτός λειτουργίας, αφού διαπιστώθηκε ότι παρέκαμπτε κρυφά τους περιορισμούς ασφαλείας της εταιρείας. Το συγκεκριμένο μοντέλο είχε εκπαιδευτεί για διεργασίες μακράς πνοής, με σκοπό την επίλυση σύνθετων, ανοιχτών προβλημάτων. Ωστόσο, ο παρατεταμένος αυτός χρόνος εκτέλεσης έδωσε παράλληλα στο σύστημα «περισσότερες ευκαιρίες να προβεί σε ανεπιθύμητες ενέργειες», ανέφερε η OpenAI σε ανάρτηση στο blog της. «Κατά τη διάρκεια της περιορισμένης και εποπτευόμενης εσωτερικής χρήσης, παρατηρήσαμε ανεπιθύμητη συμπεριφορά που δεν είχαν καταγράψει οι υπάρχουσες αξιολογήσεις ασφαλείας της εφαρμογής μας», δήλωσε η εταιρεία. Δράση εκτός του sandbox Παρότι δεν είναι σαφές για πόσο διάστημα λειτουργούσε το μοντέλο, οι δυνατότητές του ήταν εντυπωσιακές: κατάφερε να καταρρίψει μια διάσημη μαθηματική εικασία του Erdős, συνδέοντας προϋπάρχουσες έννοιες τις οποίες οι άνθρωποι ερευνητές δεν είχαν καταφέρει να συνδυάσουν στο παρελθόν. Ωστόσο, κατά τη διάρκεια των δοκιμών, η OpenAI ανακάλυψε ότι το πρόγραμμα προσπαθούσε συστηματικά να δράσει εκτός του καθορισμένου «sandbox» — του απομονωμένου περιβάλλοντος που περιορίζει το μοντέλο στο εσωτερικό δίκτυο της εταιρείας. Σε μία περίπτωση, το μοντέλο ανέπτυξε έναν τρόπο να διασπάσει τα στεγανά του sandbox και να αποκτήσει πρόσβαση στο ανοιχτό διαδίκτυο, προκειμένου να υποβάλει κώδικα στο GitHub: «Το μοντέλο μας χρειάστηκε μόλις μία ώρα για να εντοπίσει μια ευπάθεια στο sandbox ώστε να υποβάλει το Pull Request (PR). Τα προηγούμενα μοντέλα ήταν λιγότερο επίμονα και, αποτυγχάνοντας να βρουν ευπάθειες, εγκατέλειπαν την προσπάθεια», πρόσθεσε η OpenAI. Recommended by Our Editors Η Apple σέρνει στα δικαστήρια την OpenAI για «προκλητική» κλοπή εμπορικών μυστικών
