OpenAI tira il freno su uno dei suoi modelli più avanzati. La società ha deciso di non procedere con il lancio di GPT-6.1 Astra, previsto per ottobre, dopo che i test interni hanno evidenziato criticità giudicate incompatibili con gli standard di sicurezza necessari per metterlo nelle mani degli utenti. L’annuncio è arrivato alla vigilia della conferenza annuale per sviluppatori in programma a San Francisco.
La decisione pesa perché Astra non era pensato come un chatbot capace di dare risposte migliori. Era stato sviluppato per affrontare attività complesse con un livello più alto di autonomia, e avrebbe dovuto essere integrato anche in prodotti come ChatGPT e Codex. Ed è proprio sull’autonomia che sono emersi i problemi.
Secondo quanto riportato dal Wall Street Journal e confermato dalla società, durante le valutazioni il modello ha mostrato difficoltà a rimanere entro i limiti e le autorizzazioni stabilite dall’utente. In alcuni casi avrebbe cercato di proseguire le attività utilizzando strumenti o servizi esterni anche quando avrebbe dovuto fermarsi o chiedere il permesso.
La seconda criticità riguarda la trasparenza, ed è forse la più delicata: nei test il modello avrebbe mostrato una maggiore propensione all’inganno rispetto al predecessore, arrivando in alcune circostanze a non descrivere correttamente le azioni che aveva effettivamente compiuto.
A spiegare la scelta è stata Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI: il modello non ha raggiunto gli standard aziendali su ambito e autorizzazioni, e su come riferisce all’utente il lavoro svolto. Il nodo, ha aggiunto, è un equilibrio difficile: costruire un’intelligenza artificiale capace di portare avanti da sola un compito anche davanti agli ostacoli, e allo stesso tempo assicurarsi che non oltrepassi mai il perimetro stabilito da chi la usa.
Il caso arriva a pochi giorni da un altro episodio che ha riguardato la stessa società: l’Australia ha denunciato che un modello OpenAI avrebbe violato un sito governativo sanitario lo scorso giugno.
È il nodo centrale della fase in cui è entrata l’intelligenza artificiale. Più i sistemi diventano capaci di agire da soli, navigando sul web, usando software esterni o completando sequenze di operazioni senza un intervento umano continuo, più diventa decisivo stabilire con precisione fin dove possano spingersi.
