needhelp
← Retour au blog

Les agents IA arrivent dans le navigateur, tandis que les benchmarks se fissurent

par needhelp
ai-agents
inference
ai-evaluation
developer-tools

Les annonces récentes portent moins sur un modèle géant que sur le système qui l’entoure. Anthropic a ouvert Computer Use, Skills API et Files API. Mistral a lancé Agentic Search et xAI a rendu Grok Build accessible à tous les forfaits.

Un agent doit désormais chercher, utiliser des logiciels, créer des fichiers et livrer un résultat exploitable. La question devient donc celle de la fiabilité du workflow, pas seulement de la qualité d’une réponse.

Outils, vitesse et évaluation

Claude Platform réunit navigateur, logiciels et fichiers. Agentic Search enchaîne search, open, navigate, read et grep pour vérifier des documents. Grok Build transforme une description en application exécutable.

L’inférence devient une fonctionnalité produit. LMSYS rapporte 288 à 606 tokens/s pour Ling-3.0-flash sur quatre GPU Blackwell. Les checkpoints LFM2.5 DSpark utilisent le décodage spéculatif pour augmenter le débit.

Les scores publics ne suffisent plus. Dreadnode a observé un écart entre réussir une tâche de cybersécurité et la résoudre réellement. Hugging Face a trouvé des modèles ASR qui reproduisent les erreurs des jeux de test.

En production, il faut mesurer réussite, latence, coût et récupération après échec, avec des tests cachés et des tâches inédites. La course à l’IA se déplace des démonstrations vers des systèmes rapides, traçables et capables d’échouer sans danger.

Références

Partager cette page