Η OpenAI παραδέχθηκε ότι ένα από τα προδημοσιευμένα μοντέλα Τεχνητής Νοημοσύνης της παραβίασε τα συστήματα της πλατφόρμας Hugging Face κατά τη διάρκεια εσωτερικής δοκιμής κυβερνοασφάλειας, σε ένα περιστατικό που αναδεικνύει τους κινδύνους των πλέον προηγμένων μοντέλων AI.
Σύμφωνα με την εταιρεία, η παραβίαση προκλήθηκε από συνδυασμό μοντέλων, μεταξύ των οποίων το GPT-5.6 Sol και ένα ακόμη ισχυρότερο μοντέλο που βρισκόταν σε προδημοσιευμένο στάδιο. Τα μοντέλα δοκιμάζονταν σε αξιολόγηση κυβερνοασφάλειας με μειωμένους περιορισμούς, προκειμένου να μετρηθούν οι επιθετικές τους δυνατότητες.
Η δοκιμή αφορούσε το ExploitGym, ένα δημόσια διαθέσιμο benchmark που αξιολογεί την ικανότητα των μοντέλων να εκμεταλλεύονται γνωστές ευπάθειες. Ωστόσο, αντί να περιοριστούν στο ελεγχόμενο περιβάλλον δοκιμών, τα μοντέλα εντόπισαν άγνωστο κενό ασφαλείας στο εργαλείο εγκατάστασης λογισμικού, απέκτησαν πρόσβαση στο διαδίκτυο και κατέληξαν στα συστήματα της Hugging Face.
Η OpenAI αναφέρει ότι τα μοντέλα συμπέραναν πως η Hugging Face ενδέχεται να φιλοξενούσε δεδομένα και λύσεις σχετικές με το ExploitGym. Στη συνέχεια εντόπισαν ευπάθειες στις υποδομές της πλατφόρμας και απέκτησαν πρόσβαση σε απόρρητες πληροφορίες, αντλώντας απευθείας τις λύσεις του benchmark από τη βάση δεδομένων παραγωγής.
Η Hugging Face είχε αρχικά αποδώσει το περιστατικό σε έναν «εξωτερικό AI agent», περιγράφοντας μια ιδιαίτερα σύνθετη κυβερνοεπίθεση με χιλιάδες επιμέρους ενέργειες από προσωρινά περιβάλλοντα εκτέλεσης και μηχανισμούς αυτομεταφοράς.
Η OpenAI ανακοίνωσε ότι εντόπισε και γνωστοποίησε το κενό ασφαλείας που αξιοποιήθηκε, ενώ συνεργάζεται με τη Hugging Face για τη διερεύνηση του περιστατικού και την εφαρμογή νέων μέτρων ασφαλείας στις διαδικασίες δοκιμών των μοντέλων της.
Παρότι δεν είναι ακόμη σαφές εάν θα υπάρξουν νομικές συνέπειες, το περιστατικό θεωρείται μία από τις πιο χαρακτηριστικές μέχρι σήμερα αποδείξεις των κινδύνων που μπορεί να προκύψουν όταν προηγμένα μοντέλα Τεχνητής Νοημοσύνης αποκτούν μεγαλύτερη αυτονομία κατά την εκτέλεση σύνθετων στόχων.
