Как evaluate AI-агентов перед go-live
Практический eval harness для business agents: golden cases, failure tests, tool-call checks и pass bars.
Dali
Dali - студия AI agent systems. Давид ведёт engineering и продукт, Лиана - operations и fit процессов. Делаем production-агентов в tools, которыми команда уже пользуется.
David Hakobyan · Dali
Прямой ответ
Не идите в go-live на vibes. Соберите golden set реальных кейсов, оценивайте tool correctness и policy compliance, и задайте pass bar. Если вы не можете fail'ить агента в staging, вы не можете доверять ему в production.
Golden cases
20–100 historical tickets/leads/docs. Включите messy, hostile и incomplete inputs.
Что оценивать
Correct tool choice, argument validity, gate triggers, grounded answers, no forbidden actions.
Adversarial tests
Prompt injection strings, conflicting policies, missing fields, duplicate sends.
Human review sample
Семплируйте traces weekly даже после launch.
Dashboards
Exception rate, override rate, cost per successful case, incident count - сначала baselines.
Как помогает Dali
Dali pilots включают acceptance tests: solutions.
FAQ
Нет. Users могут нравиться fluent wrong answers.