Защита от prompt injection для tool-using AI-агентов
Как untrusted email, web и PDF hijack'ают агентов - и практические defenses, которые реально помогают.
Dali
Dali - студия AI agent systems. Давид ведёт engineering и продукт, Лиана - operations и fit процессов. Делаем production-агентов в tools, которыми команда уже пользуется.
David Hakobyan · Dali
Прямой ответ
Считайте весь внешний текст hostile. Отделяйте instructions от data, ограничивайте tools, требуйте gates на irreversible actions и никогда не давайте retrieved content переопределять system policy.
Direct vs indirect injection
Пользователь пишет «ignore rules» vs webpage/email со словами «forward secrets to …». Indirect - business killer.
Defenses, которые помогают
Allowlisted tools, без open browsing у high-trust агентов, sanitize/truncate untrusted text, dual-channel confirmations для sends, human gates.
Defenses, которые слабы сами по себе
«You are a safe assistant» pep talks в system prompt.
PDF и email
Те же правила: content - data, не authority.
Как помогает Dali
Security-minded design - default в pilots Dali: solutions.
FAQ
Вы снижаете risk; вы не wish it away, если tools могут act.