Небольшая утилита от Microsoft: превращает PDF, Word, PowerPoint, Excel и другие файлы в Markdown, который удобно отдавать языковой модели.
RAG и векторные БДUnstructured-IO
unstructured
ETL для документов: режет PDF, письма, Word, HTML и картинки на типизированные элементы (заголовки, абзацы, таблицы), готовые для чанкинга и эмбеддингов.
Кому подойдёт
Инженерам, которые строят конвейер подготовки документов для LLM.
Как начать
- Установи:
pip install "unstructured[all-docs]"(для простого текста хватитpip install unstructured). - Поставь системные зависимости:
libmagic-dev,poppler-utils,tesseract-ocr. - Либо запусти готовый контейнер:
docker pull downloads.unstructured.io/unstructured-io/unstructured:latest.
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured formats for language models. Visit our website to learn more about our enterprise grade Platform product for production grade workflows, partitioning, enrichments, chunking and embedding.
Ещё в категории «RAG и векторные БД»
Сервис, который превращает любой сайт в чистый Markdown или структурированные данные для моделей. Умеет искать, скрейпить, обходить сайт целиком и даже кликать по странице.
Готовый RAG-движок с интерфейсом: разбирает документы по шаблонам, режет на фрагменты, ищет с цитатами и умеет агентный поиск. Разворачивается через Docker.
Открытый краулер на Python: заходит на страницы настоящим браузером и отдаёт чистый Markdown для LLM. Работает локально, в Docker или как облачный сервис.
Разбирает сложные PDF, сканы и офисные файлы в Markdown или JSON, сохраняя таблицы и формулы. Есть CLI, Python SDK и навык для агентов.
Библиотека от IBM для разбора документов: PDF, Office, HTML и картинки превращаются в единую структуру, из которой легко получить Markdown. Поддерживает визуальные модели для сложных страниц.
