Когда формула 1967 года решает главную проблему современного AI
Элегантный фикс Sutton
У обучения с подкреплением есть грязный секрет: обучение моделей в стриминговых средах фундаментально сломано. Алгоритмы, прекрасно работающие в чистых лабораторных условиях, разваливаются в реальном мире.
Richard Sutton, крестный отец RL, только что исправил это. И его решение почти смущающе элегантно: формула из 1967 года.
«Intent Update Algorithm» ограничивает сдвиг вывода модели с каждым новым фрагментом данных. Вместо метания между противоречивыми сигналами модель движется намеренно.
Результат? Вычисления сокращаются до 1/140 от мейнстримных алгоритмов.
Почему это важно
Прорыв Sutton открывает дверь edge-device обучению с подкреплением. Роботы, обучающиеся непрерывно без серверной фермы. Дроны, адаптирующиеся к ветру в реальном времени. Медицинские устройства, уточняющие модели на устройстве, сохраняя приватность.
Математический рекорд, потрясший Google
Wang Yiping, выпускник Чжэцзянского университета, используя самодельные AI-инструменты, сделал то, что не смогла команда Google: улучшил нижнюю границу числа Рамсея — проблема, не поддававшаяся улучшению 30 лет.
Один сервер и кастомный AI против институционального гиганта — и победа.
Новый научный метод
AI становится научным инструментом — таким же фундаментальным, как микроскоп или телескоп.
- Выбор проблем меняется: узкое место смещается от «можем ли мы решить это?» к «какие проблемы стоит решать?»
- Одиночные исследователи получают рычаг: один человек с правильными AI-инструментами конкурирует с институтами
- Старые знания обретают новую жизнь: формула Sutton 1967 — напоминание, что AI-революция не только про изобретение нового