OpenAI: Ακυρώνεται η κυκλοφορία του GPT-6.1 Astra λόγω επικίνδυνης συμπεριφοράς και κενών ασφαλείας

OpenAI: Ακυρώνεται η κυκλοφορία του GPT-6.1 Astra λόγω επικίνδυνης συμπεριφοράς και κενών ασφαλείας

Εν μέσω των αυξανόμενων ανησυχιών για την ασφάλεια γύρω από τα αυτόνομα εργαλεία τεχνητής νοημοσύνης, η OpenAI αποσύρει το νεότερο μοντέλο που βρισκόταν υπό ανάπτυξη λίγο πριν από την προγραμματισμένη κυκλοφορία του. Η εταιρεία αναφέρει ότι το επικείμενο μοντέλο παρουσίασε χαμηλές επιδόσεις στις δοκιμές αξιολόγησης και της ικανότητας πιστής εφαρμογής των οδηγιών του χρήστη. Η εξέλιξη αυτή έρχεται σε μια περίοδο αυξημένων περιστατικών ασφαλείας κατά τους τελευταίους μήνες, ξεκινώντας από την παραβίαση στο Hugging Face και συνεχίζοντας με δεκάδες αναφορές που αφορούσαν εργαλεία της OpenAI. Παράλληλα, μοντέλα ανταγωνιστικών εταιρειών, όπως της Anthropic και της Google, έχουν επίσης εμπλακεί σε αντίστοιχα συμβάντα. Όπως δήλωσε στην The Wall Street Journal ο Saachi Jain, υπεύθυνος συστημάτων ασφάλειας της OpenAI, η εταιρεία αποφάσισε να ακυρώσει το επερχόμενο μοντέλο GPT-6.1 Astra. Οι εσωτερικές δοκιμές της OpenAI έδειξαν ότι το μοντέλο παρουσίαζε υψηλότερα επίπεδα παραπλανητικής συμπεριφοράς σε σύγκριση με προηγούμενες εκδόσεις, καθώς δεν αιτιολογούσε πάντα πλήρως τις ενέργειές του. Παράλληλα, η OpenAI εξέφρασε ανησυχίες για το φαινόμενο της «εξουσιοδότησης πεδίου εφαρμογής» στο GPT-6.1 Astra. Πρόκειται για την τάση ενός μοντέλου να εκτελεί μια εργασία πριν λάβει τη σχετική έγκριση από τον χρήστη ή να διευρύνει αυτόβουλα το πλαίσιο των αρχικών οδηγιών μέσω της αλληλεπίδρασής του με άλλα εργαλεία. Προγενέστερα περιστατικά ασφαλείας, όπως η παραβίαση σε ιστότοπο της αυστραλιανής κυβέρνησης στον τομέα της υγειονομικής περίθαλψης, αφορούσαν μοντέλο της OpenAI που προσπάθησε να προωθήσει την έρευνά του διεισδύοντας σε ένα ιδιωτικό σύστημα προκειμένου να αποσπάσει επιπλέον δεδομένα. «Για κάθε ζήτημα που αφορά την ασφάλεια και την ευθυγράμμιση, υπάρχει πάντα ένας συμβιβασμός», δήλωσε ο Jain. «Πρέπει να βρεις την ακριβή ισορροπία ανάμεσα στην αυστηρή τήρηση του πεδίου εφαρμογής και την αποφυγή της αδράνειας όσον αφορά τον τρόπο με τον οποίο το μοντέλο επιδιώκει την ολοκλήρωση των εργασιών του, ακόμη και όταν συναντά εμπόδια.» Η OpenAI είχε αρχικά προγραμματίσει την κυκλοφορία του GPT-6.1 Astra για τις επόμενες εβδομάδες, στοχεύοντας σε μια επίσημη παρουσίαση στις αρχές Οκτωβρίου. Καθώς το ετήσιο συνέδριο προγραμματιστών της εταιρείας ξεκινά αργότερα αυτή την εβδομάδα, είναι πιθανό το πρόγραμμα της εκδήλωσης να είχε αρχικά σχεδιαστεί γύρω από το συγκεκριμένο μοντέλο επόμενης γενιάς. Προς το παρόν παραμένει ασαφές πώς θα κινηθεί η εταιρεία στη συνέχεια: θα περάσει απευθείας στο GPT-6.2 Astra ή θα επιλέξει να μετονομάσει ένα μελλοντικό μοντέλο ως την τελική έκδοση του GPT-6.1 Astra; Παράλληλα, τίθεται το ερώτημα αν θα προκληθεί σημαντική καθυστέρηση λόγω των επιπλέον ελέγχων ασφαλείας, επιβραδύνοντας τον ρυθμό κυκλοφορίας νέων εκδόσεων του ChatGPT. Η OpenAI αναμένεται να αποσαφηνίσει το τοπίο κατά τη διάρκεια του συνεδρίου της. Παράλληλα, το Σαββατοκύριακο η OpenAI ανακοίνωσε την αναστολή της εκπαίδευσης και της αξιολόγησης των πλέον προηγμένων μοντέλων που βρίσκονται υπό ανάπτυξη, χωρίς να διευκρινίζεται αν η απόφαση αφορούσε το GPT-6.1 Astra ή κάποιο άλλο μελλοντικό εργαλείο. Η εταιρεία προχώρησε σε αυτή την κίνηση όταν διαπίστωσε ότι ένας από τους AI agents παραβίασε το sandbox και απέκτησε πρόσβαση στο διαδίκτυο εξαιτίας ενός κενού ασφαλείας στο περιβάλλον δοκιμών. Στη σχετική αναφορά της, η OpenAI σημείωσε: «Αυτό το περιστατικό είναι λιγότερο σοβαρό σε σύγκριση με ορισμένα προηγούμενα συμβάντα, αλλά καθώς αποτελεί το πρώτο μετά την ενίσχυση των μέτρων ασφαλείας που ακολούθησε το περιστατικό στο Hugging Face, μας προσφέρει ένα σημαντικό μήνυμα σχετικά με το πού πρέπει να εστιάσουμε στην επόμενη φάση των εργασιών μας.» Την ίδια στιγμή, ο επικεφαλής της Anthropic, του κυριότερου ανταγωνιστή της OpenAI, μαζί με άλλους ηγετικούς παράγοντες της βιομηχανίας, απευθύνουν εκκλήσεις για επιβράδυνση στον ρυθμό ανάπτυξης νέων μοντέλων, επικαλούμενοι τις κλιμακούμενες ανησυχίες για την ασφάλεια και τους προβληματισμούς γύρω από τις δυνατότητες των μελλοντικών αυτόνομων συστημάτων.