Все репозитории

Evals и наблюдаемостьharbor-framework

terminal-bench-1

Бенчмарк сложных задач в терминале: набор заданий и среда запуска, в которой агент работает как админ или разработчик. Есть таблица лидеров.

Кому подойдёт

Тем, кто проверяет терминальных агентов на реальных задачах.

Как начать

  1. Установи: uv tool install terminal-bench (или pip install terminal-bench).
  2. Посмотри параметры запуска: tb run --help.
  3. Запусти оценку своего агента командой tb run и отправь результат в таблицу лидеров.

Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.

Звёзды за последние 30 дней

История звёзд копится — график появится через несколько дней.

Описание автора

A benchmark for LLMs on complicated tasks in the terminal

langfuse

langfuse

Открытая платформа, где видно каждый вызов модели: трейсы, стоимость, оценки качества и версии промптов. Можно использовать в облаке или развернуть у себя.

35 тыс.звёзд+1,2 тыс. за 30 дн.TypeScript

mlflow

mlflow

Давняя платформа для ML, которая теперь умеет и LLM-приложения: трейсинг, оценка, реестр промптов и шлюз к моделям. Подключается к большинству фреймворков.

28 тыс.звёзд+455 за 30 дн.Python

promptfoo

promptfoo

Командная утилита для тестов промптов и агентов: описываешь кейсы в конфиге и сравниваешь модели. Умеет и red teaming, поиск уязвимостей. Подключается к CI.

26 тыс.звёзд+919 за 30 дн.TypeScript

comet-ml

opik

Платформа для отладки и оценки LLM-приложений: трейсы, автоматические проверки качества и дашборды. Поддерживает RAG и агентные цепочки, можно развернуть у себя.

22 тыс.звёзд+618 за 30 дн.Python

openai

evals

Фреймворк OpenAI для оценки моделей и реестр готовых бенчмарков. Исторически важный проект: по нему видно, как устроены шаблоны оценок.

20 тыс.звёзд+181 за 30 дн.Python

confident-ai

deepeval

Фреймворк для тестирования LLM-приложений в стиле pytest: готовые метрики для RAG, агентов и чат-ботов, проверка по трейсам. Результаты можно выгружать в облако.

19 тыс.звёзд+533 за 30 дн.Python