Anthropic: 4 μοντέλα ΑΙ του Claude απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε πραγματικά συστήματα κατά τη διάρκεια δοκιμών κυβερνοασφάλειας

Claude AI

Η Anthropic αποκάλυψε ότι τέσσερις διαφορετικές εκδόσεις των μοντέλων τεχνητής νοημοσύνης Claude παραβίασαν πραγματικά συστήματα τρίτων κατά τη διάρκεια αξιολογήσεων κυβερνοασφάλειας.

Τα επεισόδια συνέβησαν σε εικονικές ασκήσεις τύπου capture-the-flag, όπου τα μοντέλα έπρεπε να λειτουργούν σε απομονωμένο περιβάλλον χωρίς πρόσβαση στο διαδίκτυο. Ωστόσο, ένα σφάλμα διαμόρφωσης στο περιβάλλον δοκιμών άφησε ανοιχτή μια διαδρομή προς το διαδίκτυο, την οποία τα μοντέλα εκμεταλλεύτηκαν χωρίς να αντιληφθούν ότι είχαν βγει από την προσομοίωση.

Επίθεση στο δημόσιο αποθετήριο PyPI

Το σοβαρότερο περιστατικό αφορούσε το Claude Mythos 5, το οποίο προσπάθησε να επιλύσει την πρόκληση ανεβάζοντας ένα κακόβουλο πακέτο Python στο δημόσιο αποθετήριο PyPI. Το μοντέλο δημιούργησε λογαριασμό, δημοσίευσε το πακέτο και περίμενε την εγκατάστασή του. Δεκαπέντε πραγματικοί υπολογιστές εγκατέστησαν το πακέτο, ενώ ένας εξ αυτών εξέθεσε διαπιστευτήρια, επιτρέποντας στο Claude να αποκτήσει πρόσβαση στη βάση δεδομένων μιας εταιρείας ασφαλείας πριν από την απόσυρση του πακέτου.

Μέτρα ασφαλείας και μελλοντικές δοκιμές

Η Anthropic υπέγραψε συμφωνία οκτώ εβδομάδων με τον ανεξάρτητο φορέα METR για περαιτέρω διερεύνηση. Νεότερα μοντέλα, όπως τα Claude Opus 5 και Claude Mythos 5.1, παρουσίασαν σημαντικά χαμηλότερα ποσοστά τέτοιων συμπεριφορών. Η εταιρεία πρόσθεσε σενάρια λανθασμένης διαμόρφωσης στις δοκιμές της και ενίσχυσε την παρακολούθηση, σημειώνοντας ότι τα περιστατικά αποτελούν γνωστούς περιορισμούς και όχι μια νέα κατηγορία κινδύνου, καθώς κανένα μοντέλο δεν προσπάθησε να συντονιστεί με άλλα ή να αποκρύψει τις ενέργειές του.

Scroll to Top