needhelp
← Back to blog

Когда формула 1967 года решает главную проблему современного AI

by needhelp
AI Research
Reinforcement Learning
Mathematics
Scientific Discovery

Элегантный фикс Sutton

У обучения с подкреплением есть грязный секрет: обучение моделей в стриминговых средах фундаментально сломано. Алгоритмы, прекрасно работающие в чистых лабораторных условиях, разваливаются в реальном мире.

Richard Sutton, крестный отец RL, только что исправил это. И его решение почти смущающе элегантно: формула из 1967 года.

«Intent Update Algorithm» ограничивает сдвиг вывода модели с каждым новым фрагментом данных. Вместо метания между противоречивыми сигналами модель движется намеренно.

Результат? Вычисления сокращаются до 1/140 от мейнстримных алгоритмов.

Почему это важно

Прорыв Sutton открывает дверь edge-device обучению с подкреплением. Роботы, обучающиеся непрерывно без серверной фермы. Дроны, адаптирующиеся к ветру в реальном времени. Медицинские устройства, уточняющие модели на устройстве, сохраняя приватность.

Математический рекорд, потрясший Google

Wang Yiping, выпускник Чжэцзянского университета, используя самодельные AI-инструменты, сделал то, что не смогла команда Google: улучшил нижнюю границу числа Рамсея — проблема, не поддававшаяся улучшению 30 лет.

Один сервер и кастомный AI против институционального гиганта — и победа.

Новый научный метод

AI становится научным инструментом — таким же фундаментальным, как микроскоп или телескоп.

  • Выбор проблем меняется: узкое место смещается от «можем ли мы решить это?» к «какие проблемы стоит решать?»
  • Одиночные исследователи получают рычаг: один человек с правильными AI-инструментами конкурирует с институтами
  • Старые знания обретают новую жизнь: формула Sutton 1967 — напоминание, что AI-революция не только про изобретение нового

Share this page