Блог

1 мин чтенияtutorial

Защита от prompt injection для tool-using AI-агентов

Как untrusted email, web и PDF hijack'ают агентов - и практические defenses, которые реально помогают.

Dali

Dali - студия AI agent systems. Давид ведёт engineering и продукт, Лиана - operations и fit процессов. Делаем production-агентов в tools, которыми команда уже пользуется.

David Hakobyan · Dali

Прямой ответ

Считайте весь внешний текст hostile. Отделяйте instructions от data, ограничивайте tools, требуйте gates на irreversible actions и никогда не давайте retrieved content переопределять system policy.

Direct vs indirect injection

Пользователь пишет «ignore rules» vs webpage/email со словами «forward secrets to …». Indirect - business killer.

Defenses, которые помогают

Allowlisted tools, без open browsing у high-trust агентов, sanitize/truncate untrusted text, dual-channel confirmations для sends, human gates.

Defenses, которые слабы сами по себе

«You are a safe assistant» pep talks в system prompt.

PDF и email

Те же правила: content - data, не authority.

Как помогает Dali

Security-minded design - default в pilots Dali: solutions.

FAQ

  • Вы снижаете risk; вы не wish it away, если tools могут act.