生产级 Agent:用户、任务与成功标准
1. 从问题定义开始
先写清:
- 谁使用;
- 在什么场景;
- 输入是什么;
- 期望产物;
- 可接受时间与成本;
- 哪些动作有副作用;
- 人工在哪些节点参与;
- 成功如何验证。
“做一个通用 Agent”缺少任务分布,无法选择工具、Memory 和 Eval。
2. Success Contract
user: repository maintainer
task: fix a failing unit test
inputs:
- repository
- failure log
outputs:
- scoped code changes
- test evidence
- change summary
checks:
- target test passes
- no unrelated files changed
- build remains valid
limits:
- max 20 tool calls
- max 15 minutes
confirm:
- pushing remote branch
成功标准分为机器检查、模型 rubric 和人工验收。尽量把关键事实放到机器检查。
3. 产品边界
- 支持的任务类型;
- 不支持的输入格式;
- 数据新鲜度;
- 可用工具和资源范围;
- 单任务预算;
- 并发与排队;
- 保留和删除策略;
- 失败时向用户展示什么。
边界进入 UI、文档、prompt、权限和测试,而不是只写 README。
4. 渐进上线
offline eval
-> internal shadow
-> read-only assistant
-> reversible actions with confirmation
-> limited automation
-> broader rollout
每阶段有成功率、错误率、成本和风险门槛。先观察建议质量,再开放副作用动作。
5. 用户体验
- 显示当前阶段和已完成事项;
- 对长任务提供进度与取消;
- 对确认动作显示精确影响;
- 部分成功明确列出未完成项;
- 提供证据和 trace 摘要;
- 恢复后说明从哪个检查点继续;
- 错误信息给出可行动下一步。