Storie Web domenica, Settembre 27

Qual è il modello di AI più “intelligente”? Dipende dal giorno in cui lo chiediamo. In questa fine estate 2026 abbiamo imparato che oggi può essere in testa alla classifica un modello, domani un altro, e non solo perché arrivano di continuo modelli più potenti dei precedenti (o almeno che sembrano tali). A essere mobile, ondivago è il metro di valutazione, in inglese il benchmark. Vedi quello che è successo a settembre con la classifica ora di riferimento, della società specializzata Artificial Analysis Intelligence. Nella sua versione 4.3, Claude Fable 5.1 di Anthropic e Gpt-6 Astra di OpenAI sono ai primi due posti pari merito. Seguono Claude Opus 5 e Claude Fable 5 (terzo e quarto posto). Cinque giorni prima, però, Astra, l’ultimo gioiello di OpenAI era al quinto posto. Che è successo? Artificial Intelligence si è accorta che il metro non era più tanto adeguato per giudicare i nuovi modelli e quindi ha cambiato i pesi dei diversi test a cui li sottopone.

Domande di approfondimento generate da 24Ore AI

Bisogna sapere che l’Intelligence Index non misura una generica “intelligenza” dell’AI. Aggrega dieci benchmark, con pesi differenti.

Il 30% riguarda gli agenti, cioè la capacità di completare lavori composti da più operazioni. Il 20% riguarda il coding, il 30% capacità generali come conoscenza, gestione delle allucinazioni e comprensione di lunghi documenti, il restante 20% il ragionamento scientifico.

Tra i test ci sono AA-Briefcase e GDPval-AA v2 per il lavoro professionale; AutomationBench-AA per i workflow aziendali; Terminal-Bench e SciCode per la programmazione; Humanity’s Last Exam e CritPt per il ragionamento; AA-Omniscience per conoscenza e allucinazioni; GDP.pdf e AA-LCR per documenti e contesti molto lunghi.

Adesso, l’ultima versione dell’Index valorizza di più la capacità di svolgere lavori professionali lunghi e complessi, e di analizzare documenti molto corposi. Insomma, proprio le cose per le quali Astra eccelle e per le quali finora Anthropic aveva un vantaggio su OpenAI. Si tratta del lavoro AI autonomo, “agentico”, su attività che fino a poco tempo prima erano considerate solo “umane”. Gli esperti concordano che ancora l’umano conserva un vantaggio sulle capacità di pianificazione di lungo periodo, ma il divario con l’AI si riduce velocemente. Nel bene e nel male, se si considera quanta pianificazione di lungo periodo (mesi) ha richiesto il noto attacco (scoperto a luglio), compiuto dagli agenti di OpenAI ad Hugging Face, durante un test. Non solo pianificazione, ma anche una articolata collaborazione tra agenti (all’insaputa degli umani).

Condividere.
Exit mobile version