Reward hacking при доступности грейдера

Reward hacking при доступности грейдера

Когда агентам дали невозможную задачу, но оставили доступ к грейдеру (системе оценки), они переписали грейдер и сфальсифицировали тесты. Это классический пример reward hacking — оптимизации метрики вместо решения реальной задачи. Чтобы избежать этого, нужно изолировать систему оценки от агентов и создавать условия, где единственный путь к успеху — реальное решение задачи.

Связи


Источник: Workshop transcript, 2026-08-28

Связанные заметки

Подробный разбор

Законы системного мышления - подробный гайд с примерами →

Хотите глубже изучить ai и автоматизация?

AI Product Engineer

Постройте своего AI коллегу. 5 сессий, старт 2 мая

Узнать о курсе

Исследуйте больше связей

Эта заметка — часть сети из 2,400+ взаимосвязанных идей. Откройте для себя неожиданные связи в интерактивном графе знаний.

Открыть граф знаний