needhelp
← Volver al blog

Los agentes de IA llegan al navegador mientras las pruebas muestran sus grietas

por needhelp
ai-agents
inference
ai-evaluation
developer-tools

Las novedades de esta semana se concentran en el sistema que rodea al modelo. Anthropic abrió Computer Use, Skills API y Files API; Mistral lanzó Agentic Search; y xAI hizo Grok Build disponible para todos los planes.

La dirección es clara: un agente debe buscar, operar software, generar archivos y entregar un resultado utilizable. Por eso importa tanto la fiabilidad del flujo de trabajo como la respuesta aislada del modelo.

Herramientas, velocidad y evaluación

Claude Platform combina control de software, navegador y archivos. Mistral Agentic Search usa un ciclo de search, open, navigate, read y grep para verificar documentos. Grok Build permite describir una aplicación y modificar una versión ejecutable.

La infraestructura también cambia el producto. LMSYS midió 288 a 606 tokens/s para Ling-3.0-flash en cuatro GPU Blackwell. Los checkpoints LFM2.5 DSpark usan decodificación especulativa para aumentar el rendimiento.

Los resultados de los benchmarks necesitan más cuidado. Dreadnode encontró una brecha entre aprobar tareas de ciberseguridad y resolverlas de verdad. Hugging Face también observó modelos que repiten errores de los conjuntos de prueba de ASR.

Para producción conviene medir finalización, latencia, coste y recuperación ante fallos; usar pruebas ocultas y tareas nuevas; y limitar las herramientas con permisos explícitos. La carrera de la IA se está trasladando de la demostración del modelo a los sistemas que actúan rápido y fallan de forma segura.

Referencias

Compartir esta página