needhelp
← Back to blog

Gli agenti IA arrivano nel browser mentre i benchmark mostrano crepe

by needhelp
ai-agents
inference
ai-evaluation
developer-tools

Le novità recenti riguardano meno un singolo modello enorme e più il sistema che lo circonda. Anthropic ha aperto Computer Use, Skills API e Files API; Mistral ha lanciato Agentic Search; xAI ha reso Grok Build disponibile a tutti.

Un agente deve cercare, usare software, creare file e consegnare un risultato utilizzabile. La domanda principale è quindi l’affidabilità del flusso di lavoro.

Outils et vitesse

Claude Platform unisce browser, software e file. Mistral usa ricerca in più passaggi. LMSYS ha misurato 288-606 tokens/s per Ling-3.0-flash su quattro GPU Blackwell.

Évaluation

I benchmark pubblici non bastano. Dreadnode ha trovato una distanza tra superare e risolvere davvero un compito. Hugging Face ha rilevato modelli ASR che ripetono errori dei test. In produzione bisogna misurare completamento, latenza, costo e recupero sicuro.

Références

Share this page