Фреймворк для поиска и скрытия персональных данных в тексте, изображениях и таблицах. Находит их, затем маскирует или заменяет, чтобы данные можно было безопасно отдавать модели.
Безопасностьgreshake
llm-security
Материалы к исследованию непрямой prompt injection: как вредные инструкции в письмах, страницах и коде ломают приложения с LLM. Есть демонстрации атак.
Кому подойдёт
Тем, кто хочет понять, как атакуют LLM-приложения через внешние данные.
Как начать
- Прочитай разделы Overview и Demonstrations в README
- Для запуска кода поставь зависимости:
pip install -r requirements.txt - Открой статью по ссылке и сопоставь её с демонстрациями
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
New ways of breaking app-integrated LLMs
Ещё в категории «Безопасность»
Сканер уязвимостей для LLM: прогоняет модель через набор проб на prompt injection, утечки данных, токсичность и другие сбои. Работает как консольная утилита.
Python-фреймворк, который проверяет входы и выходы LLM готовыми валидаторами из Guardrails Hub и помогает получать структурированные ответы. Ловит риски до того, как ответ дойдёт до пользователя.
Набор инструментов NVIDIA для программируемых ограничений в диалоговых системах на LLM. Правила задаются в конфигурации и управляют тем, о чём бот говорит и что делает.
Фреймворк Microsoft для проактивного поиска рисков в генеративных системах. Помогает автоматизировать красную команду против моделей и приложений.
Проект Meta по безопасности генеративного ИИ: модели-фильтры Llama Guard и Prompt Guard, сканер Code Shield и набор тестов CyberSec Eval. Объединяет защиту и проверку атакой.
