AI εναντίον AI: Πώς οι εταιρείες κυβερνοασφάλειας προσπαθούν να χαλιναγωγήσουν τους «rogue agents»

AI εναντίον AI: Πώς οι εταιρείες κυβερνοασφάλειας προσπαθούν να χαλιναγωγήσουν τους «rogue agents»

Καθώς οι συζητήσεις για την αυτοματοποιημένη παραβίαση συστημάτων τεχνητής νοημοσύνης γίνονται όλο και πιο συχνές, αρκετές εταιρείες προτείνουν λύσεις για τα μεγαλύτερα προβλήματα αυτών των ραγδαία αναπτυσσόμενων τεχνολογιών. Όπως σημειώνει το TechCrunch, η προτεινόμενη λύση έγκειται, όπως ήταν αναμενόμενο, στην ενσωμάτωση ακόμη περισσότερης τεχνητής νοημοσύνης στο ίδιο το σύστημα. Στο πλαίσιο αυτό, αρκετές νεοφυείς εταιρείες επιστρατεύουν αμυντικά συστήματα τεχνητής νοημοσύνης για την αντιμετώπιση των rogue agents. Για παράδειγμα, η Apollo Research παρουσίασε το Watcher AI, το οποίο επιβλέπει τη δραστηριότητα ενός coding agent, διασφαλίζοντας ότι οι εκτελούμενες εργασίες δεν είναι κακόβουλες, ότι αποφεύγονται οι διαρροές δεδομένων και ότι δεν διαγράφονται κρίσιμα στοιχεία χωρίς ρητή έγκριση. Το σύστημα Watcher της Apollo αξιοποιεί πολλαπλά επίπεδα παρακολούθησης βασισμένα στην τεχνητή νοημοσύνη. Το πρώτο επίπεδο πραγματοποιεί μια ταχεία επισκόπηση των διεργασιών και, εάν εντοπίσει ανησυχητική συμπεριφορά, την επισημαίνει και την παραπέμπει σε έναν πιο εξειδικευμένο μηχανισμό ανάλυσης. Μόνο αφού ολοκληρωθεί αυτή η διαδικασία εμπλέκεται ο ανθρώπινος παράγοντας για την τελική έγκριση ή απόρριψη των προτεινόμενων ενεργειών. Παράλληλα, η ανταγωνιστική Goodfire προτείνει μια διαφορετική προσέγγιση, εξετάζοντας τις εσωτερικές ενεργοποιήσεις του μοντέλου τεχνητής νοημοσύνης αντί για τα τελικά του αποτελέσματα, ώστε να διαπιστώσει αν εμπλέκεται σε κακόβουλη δραστηριότητα. Μετά την πρόσφατη επίθεση στο Hugging Face, ο CEO της Goodfire ανέφερε σε ανάρτησή του στο X ότι η εταιρεία εντείνει τις προσπάθειές στην ενίσχυση της ασφάλειας σε κρίσιμους τομείς, όπως η κυβερνοασφάλεια. Αξίζει να σημειωθεί ότι οι διαδρομές συλλογιστικής και οι περιλήψεις αποτελούν τεχνικές που ορισμένοι προγραμματιστές αξιοποιούν σε επιθέσεις «απόσταξης», όπου ένας δημιουργός εκπαιδεύει το μοντέλο του με βάση τα παραγόμενα δεδομένα ενός άλλου. Για την αντιμετώπιση αυτού του φαινομένου, ορισμένοι προγραμματιστές καθιστούν πλέον την περίληψη συλλογιστικής λιγότερο ευανάγνωστη, δυσκολεύοντας την εξαγωγή του ουσιαστικού της περιεχομένου. Φυσικά, δεν συμφωνούν όλοι ότι η τεχνητή νοημοσύνη αποτελεί τη λύση στα προβλήματα αυτά. Εναλλακτικές προσεγγίσεις στηρίζονται σε πιο αξιόπιστα αρχεία καταγραφής των δραστηριοτήτων των AI agents, τα οποία αναλύονται στη συνέχεια με παραδοσιακά εργαλεία, όπως πράττουν εδώ και χρόνια οι ειδικοί της κυβερνοασφάλειας. Παρόλο που η παρακολούθηση μέσω τεχνητής νοημοσύνης προσφέρει ευκολία, η συνδυαστική χρήση δοκιμασμένων, παραδοσιακών συστημάτων ασφαλείας ενδέχεται να αποτελεί πιο συνετή στρατηγική από την απόλυτη εξάρτηση από μια αυτοματοποίηση που δεν έχει ακόμη αποδείξει την πλήρη αξιοπιστία της.