Глоссарий
Бенчмарк
Также: benchmark · SWE-bench
Общедоступный стандартный набор задач, на котором сравнивают модели и агентов между собой. В отличие от своего набора evals, отражает не вашу задачу, а типовую.
Пример
SWE-bench проверяет, может ли агент исправить реальные issue из GitHub-репозиториев так, чтобы прошли тесты.