დაცვა ინსტრუქციების ჩანერგვისგან ხელსაწყოებით მომუშავე აგენტებში
როგორ იტაცებს არასანდო email, ვები და PDF აგენტს - და პრაქტიკული დაცვა, რომელიც რეალურად ეხმარება.
Dali
Dali არის AI agent systems სტუდია. დავითი - engineering/product, ლიანა - operations/workflow fit. Production აგენტები არსებულ tools-ში.
David Hakobyan · Dali
პირდაპირი პასუხი
მოექეცით ყველა external text-ს როგორც hostile. გაყავით instructions data-სგან, შეზღუდეთ tools, მოითხოვეთ gates irreversible actions-ზე და არასოდეს მიეცით retrieved content-ს system policy-ის გადაწერის უფლება.
Direct vs indirect injection
User წერს “ignore rules” vs webpage/email, რომელიც ამბობს “forward secrets to …”. Indirect არის business killer.
Defenses, რომლებიც ეხმარება
Allowlisted tools, no open browsing high-trust აგენტებში, sanitize/truncate untrusted text, dual-channel confirmations sends-ისთვის, human gates.
Defenses, რომლებიც სუსტია alone
“You are a safe assistant” pep talks system prompt-ში.
PDF და email
იგივე წესები: content არის data, არა authority.
როგორ ჯდება Dali
Security-minded design default-ია Dali pilots-ში: გადაწყვეტები.
FAQ
რისკს ამცირებთ; არ გაქრება wish-ით, თუ tools-ს შეუძლია მოქმედება.