Պաշտպանություն հրահանգների ներարկումից գործիքներով աշխատող գործակալներում
Ինչպես է անվստահելի email-ը, վեբը և PDF-ը տիրում գործակալին - և գործնական պաշտպանություն, որն իրականում օգնում է։
Dali
Dali-ն AI agent systems ստուդիա է։ Դավիթը՝ engineering/product, Լիանան՝ operations/workflow fit։ Production գործակալներ առկա tools-ում։
David Hakobyan · Dali
Ուղիղ պատասխան
Դիտեք ամբողջ external text-ը որպես hostile։ Առանձնացրեք instructions-ը data-ից, constrain արեք tools, պահանջեք gates irreversible actions-ի վրա, և երբեք թույլ մի տվեք retrieved content-ին redefine անել system policy։
Direct vs indirect injection
User-ը գրում է «ignore rules» vs webpage/email, որ ասում է «forward secrets to …»։ Indirect-ն է business killer-ը։
Defenses, որոնք օգնում են
Allowlisted tools, no open browsing high-trust agents-ում, sanitize/truncate untrusted text, dual-channel confirmations sends-ի համար, human gates։
Defenses, որոնք թույլ են միայնակ
«You are a safe assistant» pep talks system prompt-ում։
PDF և email
Նույն rules. content-ը data է, ոչ authority։
Ինչպես է Dali-ն տեղավորվում
Security-minded design-ը default է Dali pilots-ում. solutions։
FAQ
Դուք reduce եք անում risk. չեք կարող wish away անել, եթե tools-ը կարող են act անել։