needhelp
← Back to blog

ИИ-агенты выходят в браузер, а бенчмарки показывают слабые места

by needhelp
ai-agents
inference
ai-evaluation
developer-tools

Последние релизы посвящены не только большой модели, но и системе вокруг неё. Anthropic открыла Computer Use, Skills API и Files API; Mistral выпустила Agentic Search; xAI открыла Grok Build для всех тарифов.

Агент должен искать информацию, управлять программами, создавать файлы и выдавать готовый результат. Поэтому надёжность рабочего процесса важнее отдельного красивого ответа.

Outils et vitesse

Claude Platform объединяет браузер, программы и файлы. Mistral использует многошаговый поиск. LMSYS сообщает о росте Ling-3.0-flash с 288 до 606 tokens/s на четырёх Blackwell.

Évaluation

Публичных баллов недостаточно. Dreadnode нашла разрыв между прохождением и реальным решением задач. Hugging Face показала повторение ошибок ASR-тестов. В продакшене нужно измерять завершение, задержку, стоимость и безопасное восстановление.

Références

Share this page