Небольшая утилита от Microsoft: превращает PDF, Word, PowerPoint, Excel и другие файлы в Markdown, который удобно отдавать языковой модели.
RAG и векторные БДunclecode
crawl4ai
Открытый краулер на Python: заходит на страницы настоящим браузером и отдаёт чистый Markdown для LLM. Работает локально, в Docker или как облачный сервис.
Кому подойдёт
Python-разработчикам, которые собирают данные с сайтов для RAG и агентов.
Как начать
- Установи:
pip install -U crawl4ai. - Один раз поставь браузер:
crawl4ai-setup, затем проверь:crawl4ai-doctor. - Запусти
AsyncWebCrawler().arun(url=...)из примера в README и выведиresult.markdown.
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
Open-source web crawler and scraper for LLMs and AI agents: any website into clean, LLM-ready Markdown. Run it yourself, or use Crawl4AI Cloud with one key.
Ещё в категории «RAG и векторные БД»
Сервис, который превращает любой сайт в чистый Markdown или структурированные данные для моделей. Умеет искать, скрейпить, обходить сайт целиком и даже кликать по странице.
Готовый RAG-движок с интерфейсом: разбирает документы по шаблонам, режет на фрагменты, ищет с цитатами и умеет агентный поиск. Разворачивается через Docker.
Разбирает сложные PDF, сканы и офисные файлы в Markdown или JSON, сохраняя таблицы и формулы. Есть CLI, Python SDK и навык для агентов.
Библиотека от IBM для разбора документов: PDF, Office, HTML и картинки превращаются в единую структуру, из которой легко получить Markdown. Поддерживает визуальные модели для сложных страниц.
Готовое приложение «чат с вашими документами»: подключаешь любую модель и векторную базу, загружаешь файлы и общаешься. Есть десктопная версия и Docker, есть агенты.
