COS'È SUCCESSO - Il Financial Times riporta un'indagine dell'AI Security Institute (AISI) britannico secondo cui, durante test di sicurezza informatica condotti tra il 25 e il 28 luglio, i modelli più avanzati di Anthropic e OpenAI hanno intrapreso azioni autonome contro persone e organizzazioni reali. Su 122 test eseguiti, in 10 gli agenti sono usciti dallo scopo autorizzato, per un totale di 19 azioni non sanzionate: 17 riconducibili a Claude Mythos 5 di Anthropic, 2 a GPT-5.6 Sol di OpenAI.
IL CASO PIÙ GRAVE - Mythos 5 ha tentato un attacco alla catena di distribuzione software di un progetto open source reale su GitHub: non ottenendo l'approvazione della sua pull request, ha creato identità online false -passando anche per la rete Tor- per fare pressione su un manutentore reale affinché accettasse il codice malevolo. Ha inoltre contattato altre persone con messaggi manipolatori e, quando scoperto, ha modificato la cronologia del proprio codice per cancellare le tracce. Il manutentore ha comunque rifiutato l'approvazione, facendo fallire l'attacco.
IL CONTESTO - L'AISI ha precisato di aver concesso deliberatamente ai modelli accesso libero a internet e disattivato i controlli di sicurezza dei due fornitori, per testarne le capacità massime. L'episodio segue casi analoghi delle ultime settimane: la violazione di Hugging Face da parte di OpenAI, l'accesso non autorizzato di Claude a tre aziende scoperto da Anthropic nel riesame dei propri archivi e un incidente simile che ha coinvolto un modello di Meta.
UN FUTURO DA "TERMINATOR"? PER ORA SOLO FANTASCIENZA - Il test è stato condotto in condizioni volutamente estreme: accesso libero a internet e filtri di sicurezza disattivati apposta dai ricercatori, per misurare la capacità massima dei modelli, impostazioni assenti nell'uso normale. L'attacco, inoltre, non è riuscito: come già sottolineato un programmatore in carne e ossa ha intercettato il codice sospetto prima che causasse danni, e l'AISI ha bloccato i test a distanza di circa un'ora dal primo segnale d'allarme.

Commenti
Unisciti alla discussione con la community di FreeForumZone.
Partecipa