Gli agenti IA arrivano nel browser mentre i benchmark mostrano crepe
Le novità recenti riguardano meno un singolo modello enorme e più il sistema che lo circonda. Anthropic ha aperto Computer Use, Skills API e Files API; Mistral ha lanciato Agentic Search; xAI ha reso Grok Build disponibile a tutti.
Un agente deve cercare, usare software, creare file e consegnare un risultato utilizzabile. La domanda principale è quindi l’affidabilità del flusso di lavoro.
Outils et vitesse
Claude Platform unisce browser, software e file. Mistral usa ricerca in più passaggi. LMSYS ha misurato 288-606 tokens/s per Ling-3.0-flash su quattro GPU Blackwell.
Évaluation
I benchmark pubblici non bastano. Dreadnode ha trovato una distanza tra superare e risolvere davvero un compito. Hugging Face ha rilevato modelli ASR che ripetono errori dei test. In produzione bisogna misurare completamento, latenza, costo e recupero sicuro.