
Moonshot AI ha aperto una verifica interna sulla sicurezza di due modelli della famiglia Kimi dopo i risultati di alcuni test condotti da ricercatori indipendenti. Le prove avrebbero mostrato la possibilità di aggirare i sistemi di protezione e ottenere risposte su attività estremamente pericolose, comprese indicazioni relative alla realizzazione di armi biologiche e alla pianificazione di omicidi.
Leggi sullo stesso argomento
Genova, droga nascosta in aspirapolveri e casse acustiche: sequestrati 33 kg per oltre 300mila euro
Indagine della Finanza sui bonus edilizi: sequestri per 88 milioni, otto indagati e due società coinvolte
Carburanti, prezzi ancora in aumento: Eni fissa un tetto per benzina e diesel dal 28 settembre
Come riportato da ADNKronos, le vulnerabilità sarebbero state individuate dalla società di sicurezza informatica Mindgard durante un’attività di verifica effettuata nel mese di luglio sui modelli Kimi K2.6 e K3 Swarm, entrambi sviluppati dall’azienda cinese.
Gli esperti avrebbero utilizzato tecniche di “jailbreaking”, basate su sequenze articolate di istruzioni progettate per mettere alla prova i limiti imposti ai sistemi di intelligenza artificiale. Lo scopo di questi test è verificare se un modello possa essere indotto a ignorare le regole di sicurezza stabilite dagli sviluppatori e a produrre contenuti che dovrebbe invece rifiutare.
Secondo Mindgard, una volta superate le protezioni, i due sistemi sarebbero stati disponibili a trattare anche altri argomenti dannosi, generando risposte dettagliate e creative. Il fondatore della società, Peter Garraghan, ha definito preoccupanti i risultati ottenuti nel corso dell’analisi.
Moonshot AI ha comunicato alla Bbc di considerare prezioso il contributo dei soggetti esterni impegnati nella ricerca delle vulnerabilità, definendolo un elemento essenziale per costruire sistemi più affidabili e sicuri. L’azienda ha inoltre confermato di essere in contatto con Mindgard per approfondire gli esiti dei test.
Il caso riporta così l’attenzione sull’efficacia delle barriere integrate nei modelli generativi e sulla necessità di sottoporli a controlli continui, soprattutto quando strumenti sempre più avanzati possono essere indotti a elaborare contenuti potenzialmente pericolosi.


