Фреймворк для поиска и скрытия персональных данных в тексте, изображениях и таблицах. Находит их, затем маскирует или заменяет, чтобы данные можно было безопасно отдавать модели.
Безопасностьethz-spylab
agentdojo
Динамическая среда для оценки атак и защит для LLM-агентов. Запускает агента на задачах пользователя и проверяет, удастся ли внедрить вредную инструкцию.
Кому подойдёт
Исследователям и инженерам, которые сравнивают защиты агентов от prompt injection.
Как начать
- Установи:
pip install agentdojo - Запусти один тест:
python -m agentdojo.scripts.benchmark -s workspace -ut user_task_0 - Для полного бенчмарка укажи модель флагом
--model, как в README
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
A Dynamic Environment to Evaluate Attacks and Defenses for LLM Agents.
Ещё в категории «Безопасность»
Сканер уязвимостей для LLM: прогоняет модель через набор проб на prompt injection, утечки данных, токсичность и другие сбои. Работает как консольная утилита.
Python-фреймворк, который проверяет входы и выходы LLM готовыми валидаторами из Guardrails Hub и помогает получать структурированные ответы. Ловит риски до того, как ответ дойдёт до пользователя.
Набор инструментов NVIDIA для программируемых ограничений в диалоговых системах на LLM. Правила задаются в конфигурации и управляют тем, о чём бот говорит и что делает.
Фреймворк Microsoft для проактивного поиска рисков в генеративных системах. Помогает автоматизировать красную команду против моделей и приложений.
Проект Meta по безопасности генеративного ИИ: модели-фильтры Llama Guard и Prompt Guard, сканер Code Shield и набор тестов CyberSec Eval. Объединяет защиту и проверку атакой.
