Открытая платформа, где видно каждый вызов модели: трейсы, стоимость, оценки качества и версии промптов. Можно использовать в облаке или развернуть у себя.
Evals и наблюдаемостьfchollet
ARC-AGI
Знаменитый тест на абстрактное мышление: 800 задач-головоломок на цветных сетках, где нужно по нескольким примерам угадать правило. Людям они даются легко, моделям долго были не по силам. В репозитории данные и страница для ручного решения.
Кому подойдёт
Тем, кто хочет понять, чем проверяют «настоящий интеллект» моделей, а не заученные знания.
Как начать
- Открой папку
data: вtraining400 задач для тренировки, вevaluationещё 400 для финальной проверки. - Открой
apps/testing_interface.htmlв браузере и загрузи JSON-файл задачи. - Реши пару задач сам, а потом прогони на них свою модель.
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
The Abstraction and Reasoning Corpus
Ещё в категории «Evals и наблюдаемость»
Давняя платформа для ML, которая теперь умеет и LLM-приложения: трейсинг, оценка, реестр промптов и шлюз к моделям. Подключается к большинству фреймворков.
Командная утилита для тестов промптов и агентов: описываешь кейсы в конфиге и сравниваешь модели. Умеет и red teaming, поиск уязвимостей. Подключается к CI.
Платформа для отладки и оценки LLM-приложений: трейсы, автоматические проверки качества и дашборды. Поддерживает RAG и агентные цепочки, можно развернуть у себя.
Фреймворк OpenAI для оценки моделей и реестр готовых бенчмарков. Исторически важный проект: по нему видно, как устроены шаблоны оценок.
Фреймворк для тестирования LLM-приложений в стиле pytest: готовые метрики для RAG, агентов и чат-ботов, проверка по трейсам. Результаты можно выгружать в облако.
