Vai al contenuto

Arriva Claude Opus 4.5: test di codifica schiaccianti e annuncio dell'era "Superman" della programmazione AI

Il ritmo dei rilasci di modelli di grandi dimensioni è stato implacabile ultimamente. Proprio mentre Gemini 3 Pro era sotto i riflettori, Anthropic ha lanciato ufficialmente Claude Opus 4.5, alzando ancora una volta il livello con una forte attenzione alla programmazione e alle attività a livello di sistema.

Anthropic afferma che Opus 4.5 è complessivamente più intelligente ed efficiente. Mantiene le sue prestazioni di alto livello nelle "attività a livello di sistema" come la programmazione, gli agenti di costruzione e il controllo del computer, mostrando anche miglioramenti significativi nelle attività quotidiane come ricerca, presentazioni e analisi di fogli di calcolo. A partire da oggi, Opus 4.5 è ampiamente disponibile tramite l'app Claude, l'API e le principali piattaforme cloud che gli sviluppatori possono utilizzare tramite la chiamata API "claude-opus-4-5-20251101".

L'Opus 4.5 è al centro della scena in una stagione di debutti dell'IA

Secondo gli annunci ufficiali e il feedback dei tester, Claude Opus 4.5 ha una comprensione decisamente migliore delle richieste ambigue ed è più stabile nell'identificazione autonoma di bug complessi. È diventato il primo modello a ottenere un punteggio superiore all'80% nel benchmark reale dell'ingegneria del software, SWE-Bench Verified.

La qualità del codice del modello ha visto un aggiornamento completo. Nel test SWE-bench Multilingual, che copre otto linguaggi di programmazione, Opus 4.5 ha ottenuto il punteggio massimo in sette di essi. In un esempio convincente, il team Anthropic ha sottoposto a Opus 4.5 un test ad alta difficoltà utilizzato per assumere ingegneri delle prestazioni. Entro il limite di due ore, il modello ha superato tutti i candidati umani. Oltre all'ingegneria del software, Claude Opus 4.5 dimostra miglioramenti generali nella visione, nel ragionamento e nella matematica. Le capacità del modello stanno addirittura cominciando a superare gli standard di valutazione esistenti. In un benchmark dell'agente, il modello ha ideato una soluzione intelligente a un problema che rispettava le regole ma era al di fuori delle risposte attese dal test, dimostrando le sue capacità creative di risoluzione dei problemi.

Claude ovunque: integrato nel desktop, nel browser e in Excel

Insieme all'Opus 4.5, l'intero ecosistema Claude è stato aggiornato. Claude Code ha ricevuto due importanti aggiornamenti: "Plan Mode" per piani di esecuzione più precisi e una nuova applicazione desktop per l'esecuzione simultanea di più sessioni di agenti. Per gli utenti dell'app, è ora disponibile la funzionalità molto richiesta delle "conversazioni infinite", che consente ai dialoghi di continuare indefinitamente riassumendo automaticamente il contesto iniziale. Inoltre, l'estensione Claude per Chrome è aperta a tutti gli utenti Max e la beta Claude per Excel è stata estesa agli utenti Max, Team ed Enterprise.

Più intelligente ed economico: un importante aggiornamento alla base di Opus 4.5

Man mano che i modelli diventano più intelligenti, risolvono i problemi in modo più efficiente. Claude Opus 4.5 utilizza un numero significativamente inferiore di token rispetto ai suoi predecessori per ottenere risultati simili o migliori. Un nuovo parametro "impegno" nell'API consente agli sviluppatori di scegliere tra dare priorità alla velocità e ai costi o massimizzare la capacità del modello. A un livello di impegno medio, Opus 4.5 eguaglia le migliori prestazioni di Sonnet 4.5 su SWE-bench Verified ma con il 76% in meno di token di output. Anthropic ha inoltre introdotto tre nuove funzionalità per risolvere la sfida della gestione di numerosi strumenti nei flussi di lavoro degli agenti: "Strumento di ricerca degli strumenti", "Chiamata degli strumenti programmatici" e "Esempi di utilizzo degli strumenti", che hanno aumentato significativamente la precisione nei complessi test multi-strumento riducendo l'utilizzo dei token e migliorando la selezione degli strumenti.

Questa versione evidenzia una tendenza emergente: diversi modelli di intelligenza artificiale stanno sviluppando "personalità" distinte. La linea Opus eccelle nella programmazione, nel ragionamento strutturato e nelle operazioni di sistema, mentre modelli come Sonnet possono essere più convenienti per la scrittura creativa. Il lancio di Opus 4.5 conferma questa specializzazione. In futuro, la selezione di un modello di intelligenza artificiale riguarderà meno i punteggi in classifica e più la ricerca di un "collega" il cui stile di lavoro sia in linea con le tue esigenze.

_{area}

_{region}
_{language}