KI-Agenten kommen in den Browser, während Benchmarks Risse zeigen
Die jüngsten KI-Veröffentlichungen handeln weniger von einem einzelnen riesigen Modell als vom System darum herum. Anthropic öffnete Computer Use, Skills API und Files API; Mistral brachte Agentic Search heraus; xAI stellte Grok Build allen Tarifen bereit.
Ein Agent soll suchen, Software bedienen, Dateien erzeugen und ein nutzbares Ergebnis liefern. Deshalb zählen Workflow-Zuverlässigkeit, Berechtigungen und Prüfpunkte mehr als eine isolierte Chat-Antwort.
Outils et vitesse
Claude Platform verbindet Browser-, Software- und Dateiaufgaben. Mistral nutzt mehrstufige Suche. LMSYS meldet 288 bis 606 tokens/s für Ling-3.0-flash auf vier Blackwell-GPUs.
Évaluation
Öffentliche Benchmarks reichen nicht mehr aus: Dreadnode fand einen Abstand zwischen Bestehen und echtem Lösen. Hugging Face zeigte ASR-Modelle, die Testfehler reproduzieren. In der Produktion sollten Abschlussrate, Latenz, Kosten und sichere Wiederherstellung gemeinsam gemessen werden.