ბლოგი

1 წთ კითხვაtutorial

დაცვა ინსტრუქციების ჩანერგვისგან ხელსაწყოებით მომუშავე აგენტებში

როგორ იტაცებს არასანდო email, ვები და PDF აგენტს - და პრაქტიკული დაცვა, რომელიც რეალურად ეხმარება.

Dali

Dali არის AI agent systems სტუდია. დავითი - engineering/product, ლიანა - operations/workflow fit. Production აგენტები არსებულ tools-ში.

David Hakobyan · Dali

პირდაპირი პასუხი

მოექეცით ყველა external text-ს როგორც hostile. გაყავით instructions data-სგან, შეზღუდეთ tools, მოითხოვეთ gates irreversible actions-ზე და არასოდეს მიეცით retrieved content-ს system policy-ის გადაწერის უფლება.

Direct vs indirect injection

User წერს “ignore rules” vs webpage/email, რომელიც ამბობს “forward secrets to …”. Indirect არის business killer.

Defenses, რომლებიც ეხმარება

Allowlisted tools, no open browsing high-trust აგენტებში, sanitize/truncate untrusted text, dual-channel confirmations sends-ისთვის, human gates.

Defenses, რომლებიც სუსტია alone

“You are a safe assistant” pep talks system prompt-ში.

PDF და email

იგივე წესები: content არის data, არა authority.

როგორ ჯდება Dali

Security-minded design default-ია Dali pilots-ში: გადაწყვეტები.

FAQ

  • რისკს ამცირებთ; არ გაქრება wish-ით, თუ tools-ს შეუძლია მოქმედება.