Обучение с подкреплением
Изучение ИИ, 7–11 класс · раздел «15. Машинное обучение своими руками»
Главное
Агент пробует действия и получает награды или штрафы, постепенно находя лучшую стратегию. Так ИИ научился играть в го и видеоигры, так же дообучают языковые модели.
Правила
- Действие → награда
- Проб и ошибок
- Стратегия улучшается
Разберём пример
Как AlphaGo стала сильнее чемпионов?
Играла сама с собой миллионы партий и училась на наградах за победы
Частые ошибки
- Считать, что агента учат по готовым правильным ответам.
Потренироваться
Задания с проверкой и подсказками, схема темы и разбор ошибок с ИИ-репетитором — в уроке на платформе.
Открыть урок