needhelp
← 返回博客

AI 智能体开始操作浏览器,评测榜单也暴露裂缝

作者 needhelp
ai-agents
inference
ai-evaluation
developer-tools

最近的 AI 更新,重点已经从“再发布一个更大的模型”转向模型周围的系统。Anthropic 开放了 Claude Platform 的 Computer Use、Skills API 和 Files API;Mistral 发布 Agentic Search;xAI 让所有套餐都能使用 Grok Build。

它们指向同一个变化:模型需要搜索资料、操作软件、生成文件,并交付一个能继续使用的结果。工程问题也随之改变:关键不再只是“哪个模型回答最好”,而是“哪个工作流能稳定完成任务”。

工具层正在成为产品本身

Anthropic 的平台更新 把浏览器操作、软件控制和文件生成放到同一套能力中。Mistral 的 Agentic Search 则通过 search、open、navigate、read、grep 组成多步检索循环。

Grok Build 把这个思路用于应用创建:描述网站或游戏,再对运行中的版本继续修改。Claude 也能连接 Gmail 和 Google Drive,并允许在发邮件或改文件前请求批准。

真正有价值的单位不再是一次聊天回答,而是一次有权限、有检查点、有交接边界的受控动作。

推理速度已经是产品功能

LMSYS 的优化报告 显示,Ling-3.0-flash 在四块 Blackwell GPU 上的单请求速度从 288 tokens/s 提升到 606 tokens/s。蚂蚁百灵的 Weight Cache Daemon 则称,在一项 FP8 工作负载中,引擎启动时间从 8.8 分钟缩短到约 0.53 分钟。

Hugging Face 发布的 LFM2.5 DSpark 检查点 使用投机解码提升吞吐,同时不改变目标模型的输出。缓存、草稿模型和量化听起来像底层优化,但用户感受到的是更快的智能体和更低的账单。

评测问题越来越难忽略

Dreadnode 的审计 发现,网络安全任务“通过”和真正解决之间存在明显差距。Hugging Face 的 ASR 分析 也发现,一些模型会复现基准数据里的错误,而不是忠实转写音频。

结论很直接:生产评测需要隐藏测试、数据来源检查和真实任务结果。公开榜单分数更高,并不能单独证明智能体已经适合上线。

开发者现在该做什么

  • 给智能体配置范围明确的工具和审批边界。
  • 同时记录完成率、延迟、成本和回滚率。
  • 用新任务和对抗性任务测试,不要只测公开基准。
  • 把缓存、草稿模型和量化当作产品设计的一部分。

AI 竞争正在从模型演示转向可靠系统。能让智能体快速行动、解释行动过程,并在失败时安全退出的团队,更可能把能力真正交付给用户。

参考

分享本页