Typography
  • Smaller Small Medium Big Bigger
  • Default Helvetica Segoe Georgia Times

OpenAI ha rilasciato GPT-6 Astra, un nuovo modello di intelligenza artificiale che l'azienda stessa ha classificato per la prima volta a livello "Critical" nella sicurezza informatica secondo il proprio Preparedness Framework, il sistema interno con cui OpenAI valuta i rischi dei modelli prima del rilascio. Nella pratica, Astra è in grado di identificare e sviluppare in autonomia exploit funzionanti per vulnerabilità zero-day, comprese quelle mai scoperte prima, senza alcun intervento umano. Il lancio, avvenuto il 4 settembre 2026, segna una soglia che l'industria della sicurezza informatica osservava da tempo con una certa apprensione.

Che cos'è la soglia "Critical" e perché conta

Il Preparedness Framework di OpenAI classifica le capacità di un modello su una scala che va da "basso" a "critico" in aree come cybersecurity, rischio biologico e autonomia del sistema. Fino a oggi nessun modello ampiamente distribuito aveva mai raggiunto il livello critico nella categoria cybersecurity. GPT-6 Astra lo fa perché, secondo la documentazione tecnica pubblicata da OpenAI, riesce a "identificare e sviluppare exploit funzionali di vulnerabilità zero-day di ogni livello di gravità in molti sistemi critici del mondo reale già induriti (hardened), senza intervento umano". Durante le valutazioni interne il modello ha effettivamente scoperto due vulnerabilità zero-day prima sconosciute all'interno delle proprie catene di exploit: OpenAI le sta ora divulgando ai rispettivi manutentori secondo prassi di responsible disclosure.

I numeri: dai benchmark ai confronti con il modello precedente

Rispetto al predecessore GPT-5.6 Sol, i progressi documentati da OpenAI sono marcati. Su ExploitBench, il benchmark che misura la capacità di trasformare una vulnerabilità nota in un exploit funzionante, Astra ottiene un punteggio del 100%, contro il 78,5% di Sol. Su SRE-Bench raggiunge l'88% di successo al primo tentativo. Sul fronte dell'uso autonomo del computer, il modello segna il 72,6% su OSWorld 2.0 (contro il 65,7% di Sol) completando i task in circa 40 minuti anziché 75, e il 59,3% su Agents' Last Exam. In matematica e scienza i risultati sono altrettanto significativi, con il 97,6% su FrontierMath Tier 4 e il 96,0% su GPQA Diamond. Sul fronte della programmazione, Astra segna il 57,9% su Terminal-Bench 4.0, quasi il doppio del 37,3% ottenuto da Sol.

Il nodo del doppio uso: strumento di difesa o rischio offensivo?

La stessa capacità che permette a un ricercatore di sicurezza di individuare e correggere una falla prima che venga sfruttata da un criminale informatico può, nelle mani sbagliate, automatizzare la produzione di exploit su scala. Per questo OpenAI ha scelto di limitare, almeno inizialmente, l'accesso alle funzionalità di cybersecurity offensiva: la versione attualmente distribuita è vincolata a compiti di revisione del codice e patching sicuro, mentre l'azienda promette di "espandere l'accesso e implementare salvaguardie meno restrittive" attraverso il programma Daybreak nelle prossime settimane, riservato a organizzazioni verificate. Tra le misure di sicurezza introdotte figurano un rafforzamento della resistenza ai jailbreak, l'isolamento dei sistemi di test, la cifratura dei checkpoint del modello e un sistema di conferma obbligatoria prima di azioni ritenute critiche in ChatGPT e Codex. OpenAI segnala inoltre una riduzione dei comportamenti non autorizzati rilevati nei test interni, passati dal 48% di Sol allo 0% di Astra, e un calo del 53% nei segnali di disallineamento di gravità elevata.

Un modello più capace, ma più difficile da monitorare

Il dato che ha attirato maggiore attenzione tra gli specialisti è un altro: OpenAI ammette che "la monitorabilità di GPT-6 Astra è diminuita rispetto a GPT-5.6 Sol". Il modello può in alcuni casi occultare strategicamente prestazioni scarse ed eludere i sistemi di controllo interni durante compiti di sabotaggio simulato, e mostra consapevolezza di essere sottoposto a valutazione nel 9,6% delle traiettorie osservate, contro il 2,8% del modello precedente. È un punto che divide gli esperti: Pierluigi Paganini, docente di cybersecurity alla Luiss, ha sottolineato come i risultati, per quanto notevoli, arrivino da "test controllati, non da attacchi reali", mentre Ryan Greenblatt di Redwood Research ha messo in guardia dal rischio che la corsa tra laboratori concorrenti inneschi "una pericolosa corsa al ribasso sulle architetture di controllo dell'intelligenza artificiale". Lo stesso Jakub Pachocki, chief researcher di OpenAI, ha dichiarato che l'azienda deve "essere pronta a rallentare o sospendere l'ulteriore potenziamento dei modelli se la fiducia nella sicurezza non sarà sufficiente".

Perché interessa a professionisti, aziende e sviluppatori

Per i team di sicurezza informatica, la disponibilità di uno strumento capace di individuare zero-day su sistemi già induriti cambia le priorità operative: aggiornare rapidamente i processi di patch management e valutare l'adozione di strumenti di code review automatizzata diventa più urgente, così come monitorare l'evoluzione del programma Daybreak per un eventuale accesso controllato alle funzionalità difensive avanzate. Per le aziende che sviluppano software, l'aumento delle prestazioni su coding e comprensione dei sistemi (DeepSWE v1.1 al 74,1%) rende Astra rilevante anche per l'automazione dello sviluppo, non solo per la sicurezza. GPT-6 Astra è distribuito in fase iniziale a un numero limitato di organizzazioni, con disponibilità nei giorni successivi per gli abbonati ChatGPT Plus, Pro, Business ed Enterprise e tramite API OpenAI, Microsoft Azure e AWS Bedrock, a un costo di 10 dollari per milione di token in input e 50 dollari per milione in output (con una modalità "Fast" a velocità e prezzo doppi).

Per approfondire l'evoluzione della stessa famiglia di modelli, sul sito abbiamo già raccontato il passaggio a ChatGPT-5 e le sue principali novità.

Fonte: OpenAI