Все репозитории

RAG и векторные БДstanford-futuredata

ColBERT

Модель поиска, которая сравнивает запрос и документ по отдельным токенам, а не одним вектором. Так точность выше, а поиск по большим коллекциям занимает десятки миллисекунд.

Кому подойдёт

Тем, кто упёрся в качество обычного векторного поиска и готов разобраться глубже.

Как начать

  1. Установи: pip install colbert-ai[torch,faiss-gpu] (если не получилось, создай окружение: conda env create -f conda_env.yml).
  2. Скачай готовый чекпоинт ColBERTv2 по ссылке из README.
  3. Проиндексируй коллекцию через Indexer, затем ищи через Searcher по примеру из README.

Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.

Звёзды за последние 30 дней

+206 сент. — 3 окт.
3 9243 944

Описание автора

ColBERT: state-of-the-art neural search (SIGIR'20, TACL'21, NeurIPS'21, NAACL'22, CIKM'22, ACL'23, EMNLP'23)

microsoft

markitdown

Растёт быстрее всех

Небольшая утилита от Microsoft: превращает PDF, Word, PowerPoint, Excel и другие файлы в Markdown, который удобно отдавать языковой модели.

189 тыс.звёзд+11 тыс. за 30 дн.Python

firecrawl

firecrawl

Растёт быстрее всех

Сервис, который превращает любой сайт в чистый Markdown или структурированные данные для моделей. Умеет искать, скрейпить, обходить сайт целиком и даже кликать по странице.

189 тыс.звёзд+12 тыс. за 30 дн.TypeScript

infiniflow

ragflow

Готовый RAG-движок с интерфейсом: разбирает документы по шаблонам, режет на фрагменты, ищет с цитатами и умеет агентный поиск. Разворачивается через Docker.

92 тыс.звёзд+1,8 тыс. за 30 дн.Go

unclecode

crawl4ai

Открытый краулер на Python: заходит на страницы настоящим браузером и отдаёт чистый Markdown для LLM. Работает локально, в Docker или как облачный сервис.

85 тыс.звёзд+3,2 тыс. за 30 дн.Python

opendatalab

MinerU

Разбирает сложные PDF, сканы и офисные файлы в Markdown или JSON, сохраняя таблицы и формулы. Есть CLI, Python SDK и навык для агентов.

81 тыс.звёзд+2 тыс. за 30 дн.Python

docling-project

docling

Библиотека от IBM для разбора документов: PDF, Office, HTML и картинки превращаются в единую структуру, из которой легко получить Markdown. Поддерживает визуальные модели для сложных страниц.

68 тыс.звёзд+2,5 тыс. за 30 дн.Python
stanford-futuredata/ColBERT — что это и как начать