Набор навыков и методология для кодинг-агентов: сначала уточнить задачу, спланировать, писать тесты, потом код. Агент работает дисциплинированнее.
База репозиториев AI-движения
Лучшие AI-репозитории
224 живых проекта — от агентных фреймворков до защиты от prompt injection. У каждого наше описание: зачем он, кому подойдёт и как начать за три шага.
Звёзды, форки и активность обновляем каждый день через GitHub API · обновлено 6 октября 2026 г.
- репозиториев
- 224
- категорий
- 11
- звёзд суммарно
- 11 млн
- новых звёзд за 30 дней
- +235 тыс.
За 30 дней
Растут быстрее всех
Больше всего новых звёзд за последние 30 дней.
Сервис, который превращает любой сайт в чистый Markdown или структурированные данные для моделей. Умеет искать, скрейпить, обходить сайт целиком и даже кликать по странице.
Небольшая утилита от Microsoft: превращает PDF, Word, PowerPoint, Excel и другие файлы в Markdown, который удобно отдавать языковой модели.
Открытый кодинг-агент для терминала с десктопным приложением. Не привязан к одному провайдеру: подключаешь модели, какие есть.
Набор инструментов для разработки от спецификации: сначала принципы и спека, затем план и задачи, и только потом код. Работает с разными кодинг-агентами.
Лёгкий кодинг-агент от OpenAI, который запускается в терминале и работает с кодом проекта. Написан на Rust.
Категории
Каталог
12 репозиториев
Инструменты для агентов, которые управляют компьютером: драйверы для разных ОС, виртуальные машины и бенчмарки для обучения и оценки.
Исследовательский агент из Принстона и Стэнфорда: берёт GitHub-issue и пытается его починить. Задал планку на SWE-bench; авторы теперь советуют mini-swe-agent.
Фреймворк OpenAI для оценки моделей и реестр готовых бенчмарков. Исторически важный проект: по нему видно, как устроены шаблоны оценок.
Стандартный набор для прогона моделей через сотни академических бенчмарков. На нём строятся многие открытые рейтинги моделей.
Главный бенчмарк для кодинг-агентов: модель должна исправить реальные issue из GitHub-проектов, а патч проверяется тестами в контейнерах.
SDK для наблюдения за агентами: записывает сессии, считает стоимость и показывает цепочку шагов. Интегрируется с CrewAI, LangChain, OpenAI Agents SDK и другими.
Знаменитый тест на абстрактное мышление: 800 задач-головоломок на цветных сетках, где нужно по нескольким примерам угадать правило. Людям они даются легко, моделям долго были не по силам. В репозитории данные и страница для ручного решения.
Проект Meta по безопасности генеративного ИИ: модели-фильтры Llama Guard и Prompt Guard, сканер Code Shield и набор тестов CyberSec Eval. Объединяет защиту и проверку атакой.
Набор из восьми моделей разного размера, обученных на одних и тех же данных, с 154 сохранёнными чекпоинтами. Нужен, чтобы изучать, как модель учится и когда в ней появляются знания.
Фреймворк оценки моделей от британского Института безопасности ИИ: инструменты, многошаговые диалоги, проверка другой моделью и более 200 готовых оценок.
Бенчмарк сложных задач в терминале: набор заданий и среда запуска, в которой агент работает как админ или разработчик. Есть таблица лидеров.
Динамическая среда для оценки атак и защит для LLM-агентов. Запускает агента на задачах пользователя и проверяет, удастся ли внедрить вредную инструкцию.
Мы что-то упустили?
Предложить репозиторий
Пришли ссылку на GitHub и пару слов, почему он здесь нужен. Каждую заявку смотрим руками — в каталог попадает не всё.










