Все репозитории

RAG и векторные БДUnstructured-IO

unstructured

ETL для документов: режет PDF, письма, Word, HTML и картинки на типизированные элементы (заголовки, абзацы, таблицы), готовые для чанкинга и эмбеддингов.

Кому подойдёт

Инженерам, которые строят конвейер подготовки документов для LLM.

Как начать

  1. Установи: pip install "unstructured[all-docs]" (для простого текста хватит pip install unstructured).
  2. Поставь системные зависимости: libmagic-dev, poppler-utils, tesseract-ocr.
  3. Либо запусти готовый контейнер: docker pull downloads.unstructured.io/unstructured-io/unstructured:latest.

Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.

Звёзды за последние 30 дней

+1476 сент. — 6 окт.
15 38215 529

Описание автора

Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured formats for language models. Visit our website to learn more about our enterprise grade Platform product for production grade workflows, partitioning, enrichments, chunking and embedding.

microsoft

markitdown

Растёт быстрее всех

Небольшая утилита от Microsoft: превращает PDF, Word, PowerPoint, Excel и другие файлы в Markdown, который удобно отдавать языковой модели.

189 тыс.звёзд+11 тыс. за 30 дн.Python

firecrawl

firecrawl

Растёт быстрее всех

Сервис, который превращает любой сайт в чистый Markdown или структурированные данные для моделей. Умеет искать, скрейпить, обходить сайт целиком и даже кликать по странице.

189 тыс.звёзд+12 тыс. за 30 дн.TypeScript

infiniflow

ragflow

Готовый RAG-движок с интерфейсом: разбирает документы по шаблонам, режет на фрагменты, ищет с цитатами и умеет агентный поиск. Разворачивается через Docker.

92 тыс.звёзд+1,8 тыс. за 30 дн.Go

unclecode

crawl4ai

Открытый краулер на Python: заходит на страницы настоящим браузером и отдаёт чистый Markdown для LLM. Работает локально, в Docker или как облачный сервис.

85 тыс.звёзд+3,2 тыс. за 30 дн.Python

opendatalab

MinerU

Разбирает сложные PDF, сканы и офисные файлы в Markdown или JSON, сохраняя таблицы и формулы. Есть CLI, Python SDK и навык для агентов.

81 тыс.звёзд+2 тыс. за 30 дн.Python

docling-project

docling

Библиотека от IBM для разбора документов: PDF, Office, HTML и картинки превращаются в единую структуру, из которой легко получить Markdown. Поддерживает визуальные модели для сложных страниц.

68 тыс.звёзд+2,5 тыс. за 30 дн.Python
Unstructured-IO/unstructured — что это и как начать