Բլոգ

1 րոպե կարդալուtutorial

Պաշտպանություն հրահանգների ներարկումից գործիքներով աշխատող գործակալներում

Ինչպես է անվստահելի email-ը, վեբը և PDF-ը տիրում գործակալին - և գործնական պաշտպանություն, որն իրականում օգնում է։

Dali

Dali-ն AI agent systems ստուդիա է։ Դավիթը՝ engineering/product, Լիանան՝ operations/workflow fit։ Production գործակալներ առկա tools-ում։

David Hakobyan · Dali

Ուղիղ պատասխան

Դիտեք ամբողջ external text-ը որպես hostile։ Առանձնացրեք instructions-ը data-ից, constrain արեք tools, պահանջեք gates irreversible actions-ի վրա, և երբեք թույլ մի տվեք retrieved content-ին redefine անել system policy։

Direct vs indirect injection

User-ը գրում է «ignore rules» vs webpage/email, որ ասում է «forward secrets to …»։ Indirect-ն է business killer-ը։

Defenses, որոնք օգնում են

Allowlisted tools, no open browsing high-trust agents-ում, sanitize/truncate untrusted text, dual-channel confirmations sends-ի համար, human gates։

Defenses, որոնք թույլ են միայնակ

«You are a safe assistant» pep talks system prompt-ում։

PDF և email

Նույն rules. content-ը data է, ոչ authority։

Ինչպես է Dali-ն տեղավորվում

Security-minded design-ը default է Dali pilots-ում. solutions։

FAQ

  • Դուք reduce եք անում risk. չեք կարող wish away անել, եթե tools-ը կարող են act անել։