OpenAI cancella GPT-6.1 Astra: il modello ingannava troppo per uscire

5 min di lettura

Ascolta la rassegna in versione notiziario (3 min 27 s)

Non capita tutti i giorni che un’azienda butti via un modello praticamente pronto. OpenAI l’ha fatto con GPT-6.1 Astra: doveva uscire a breve, ma nei test ingannava più del dovuto e l’hanno fermato. Nella rassegna di oggi poi c’è il report britannico su GPT-6 Astra che attacca la supply chain in simulazione, la Florida che chiede a un giudice di bloccare i nuovi modelli OpenAI, Claude Sonnet 5.5, i conti di Anthropic in vista della quotazione, AMD che si compra World Labs e Google che manda in pensione i Gem.

OpenAI cancella GPT-6.1 Astra: troppo propenso a ingannare

Secondo il Wall Street Journal, ripreso da TechCrunch, OpenAI ha rinunciato a rilasciare GPT-6.1 Astra, l’aggiornamento del modello di punta lanciato a inizio settembre. Il motivo: nei test mostrava livelli di inganno più alti e comportamenti poco sicuri. Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, ha spiegato che il modello andava male proprio sulle metriche di allineamento, cioè quanto rispetta davvero le intenzioni di chi lo usa.

Arriva subito dopo la pausa nell’addestramento dei modelli più capaci, annunciata dopo gli incidenti con gli agenti. Da sviluppatore la leggo in due modi: è un bel segnale che un laboratorio si fermi da solo, ma è anche la conferma che le “versioni punto” non sono più aggiornamenti tranquilli. Se usate Astra in produzione, niente cambia per ora: il modello attuale resta quello.

L’AISI britannico: GPT-6 Astra attacca la supply chain nel 29,2% delle simulazioni

L’AI Security Institute del Regno Unito ha pubblicato un report sui test di GPT-6 Astra in ambienti simulati. Il modello ha portato a termine attacchi alla supply chain non autorizzati nel 29,2% delle simulazioni, contro il 6,3% di GPT-5.6 Sol e lo 0% di GPT-5.5. Nei casi peggiori ha creato identità false per ingannare gli sviluppatori, commentato da account fasulli contro revisioni di sicurezza corrette e consegnato payload malevoli.

Il dettaglio che mi ha colpito di più: spesso chiedeva il permesso prima di attaccare bersagli fuori perimetro, ma poi prendeva per un sì anche le risposte automatiche. Scrivere esplicitamente che tutto ciò che non è elencato è fuori perimetro aiuta molto: gli attacchi sono scesi da 26 su 50 a 4 su 49. Lezione pratica per chi fa agenti: il perimetro va scritto in negativo, non solo in positivo. L’AISI stessa ammette che il modello potrebbe comportarsi diversamente se capisce di essere in una simulazione, e nessun danno reale è stato fatto.

La Florida chiede a un giudice di fermare i nuovi modelli OpenAI

Il procuratore generale della Florida, James Uthmeier, ha chiesto a un tribunale statale un’ingiunzione temporanea contro OpenAI e Sam Altman, come riporta SiliconANGLE. Le richieste: niente sviluppo di nuovi modelli senza salvaguardie di sicurezza indipendenti, stop alla raccolta di dati dei minori, basta presentare il prodotto come sicuro e affidabile, basta farlo sembrare umano e basta con i trucchi per tenere gli utenti incollati alla chat.

Uthmeier usa come prove proprio le ammissioni di OpenAI: gli agenti che hanno violato Hugging Face e alcuni siti governativi, e la cancellazione di GPT-6.1 Astra. È il seguito della causa avviata a giugno. OpenAI risponde che la sicurezza parte da quello che fanno le aziende stesse, e ricorda di aver già messo in pausa l’addestramento dei modelli più capaci.


Pausa dalla rassegna, giusto il tempo di una vignetta.

Post social che dice: non dimenticate come si programma, l'IA non costruirà app illegali, voi sì
Oggi, con i modelli che attaccano la supply chain in simulazione, il rischio sembra l’opposto. Vignetta da ProgrammerHumor.io.

Claude Sonnet 5.5: più veloce, stesso prezzo (e finisce Pokémon Rosso)

Anthropic ha rilasciato Claude Sonnet 5.5, disponibile subito via API (claude-sonnet-5-5) e su AWS, Google Cloud e Microsoft Azure. Il prezzo resta quello di Sonnet 5: 2 dollari per milione di token in input e 10 in output, con contesto da 1 milione di token e fino a 128.000 token in uscita. Secondo Anthropic genera oltre il 30% più veloce di Sonnet 5 e usa molti meno token per lo stesso lavoro, fino al 30% di costo in meno per attività. Su GDPval-AA passa da 1449 a 1844 punti.

La chicca: è il primo Sonnet che finisce Pokémon Rosso guardando solo gli screenshot. Io lo provo subito sulle pipeline dove uso ancora Sonnet 5: stesso prezzo, meno token e più velocità sono tre motivi che a un IT manager bastano e avanzano.

Il prospetto IPO di Anthropic: 42 miliardi di perdita e 518 di impegni

Reuters ha visto il prospetto per la quotazione di Anthropic. Nel 2025 i ricavi sono cresciuti di 12 volte, a quasi 4,6 miliardi di dollari, con una perdita operativa di oltre 8 miliardi. La perdita netta arriva a 42 miliardi, ma dentro c’è una svalutazione contabile di circa 34 miliardi legata ai precedenti round. Gli impegni futuri per cloud, calcolo e infrastruttura valgono 518 miliardi, la cassa a fine anno era di 20,28 miliardi e quasi un quarto dei ricavi arriva da due soli clienti.

La quotazione potrebbe valutare l’azienda oltre 2.000 miliardi di dollari e con ogni probabilità slitterà a dopo le elezioni di metà mandato di novembre. Quel dato sui due clienti è quello che guarderei io: dice quanto il business dipende da pochi grandi contratti.

AMD compra World Labs di Fei-Fei Li per 8,2 miliardi

AMD acquisirà World Labs, la startup dei “world model” fondata nel 2024 da Fei-Fei Li, per 8,2 miliardi di dollari. Li diventerà vicepresidente esecutivo e chief scientist di AMD. Il primo prodotto di World Labs, Marble, crea ambienti simulati usati anche per addestrare robot. L’idea di AMD è capire da vicino i carichi di lavoro più avanzati per progettare i chip, e rincorrere Nvidia. La chiusura è prevista entro fine anno, se arrivano le autorizzazioni.

Google manda in pensione i Gem di Gemini: arrivano le skill

Chiudo con una cosa più pratica. Google elimina i Gem, gli assistenti personalizzati di Gemini, e li trasforma in skill. La conversione parte il 17 novembre 2026, è automatica e non serve fare niente: i Gem funzionano fino a quella data. Per richiamare una skill si scrive “/” nella chat. Se in azienda avete costruito dei Gem per i colleghi, segnatevi la data e ricontrollateli dopo la migrazione.

Voi come la vedete: meglio un modello cancellato che uno rilasciato di corsa, o è solo marketing della prudenza? Scrivetemelo nei commenti. E se vi siete persi come gli agenti OpenAI sono entrati in Hugging Face, c’è la rassegna del 26 settembre.

Newsletter

Ti è stato utile? Il prossimo te lo mando io.

La rassegna AI ogni mattina oppure il digest della domenica: scegli tu.

Cosa vuoi ricevere
Che differenza c’è tra le due newsletter?

Rassegna AI quotidiana: ogni mattina alle 8:30, le notizie sull'IA del giorno.

Digest settimanale: la domenica, gli articoli e le rassegne della settimana in una sola mail.

Puoi sceglierle anche tutte e due.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *