Блог

1 мин чтенияtutorial

Как evaluate AI-агентов перед go-live

Практический eval harness для business agents: golden cases, failure tests, tool-call checks и pass bars.

Dali

Dali - студия AI agent systems. Давид ведёт engineering и продукт, Лиана - operations и fit процессов. Делаем production-агентов в tools, которыми команда уже пользуется.

David Hakobyan · Dali

Прямой ответ

Не идите в go-live на vibes. Соберите golden set реальных кейсов, оценивайте tool correctness и policy compliance, и задайте pass bar. Если вы не можете fail'ить агента в staging, вы не можете доверять ему в production.

Golden cases

20–100 historical tickets/leads/docs. Включите messy, hostile и incomplete inputs.

Что оценивать

Correct tool choice, argument validity, gate triggers, grounded answers, no forbidden actions.

Adversarial tests

Prompt injection strings, conflicting policies, missing fields, duplicate sends.

Human review sample

Семплируйте traces weekly даже после launch.

Dashboards

Exception rate, override rate, cost per successful case, incident count - сначала baselines.

Как помогает Dali

Dali pilots включают acceptance tests: solutions.

FAQ

  • Нет. Users могут нравиться fluent wrong answers.