Damnatiox
知识文件夹

Evaluation Observability Safety

现代 Agent Engineering 学习路线:Evaluation Observability Safety

0 子目录6 文档

文档

6
评测、可观测性与安全推荐阅读评测、可观测性与安全推荐阅读 OpenAI Evals:可复现 eval 任务与评估框架。 OpenAI Agents SDK Tracing:Agent、handoff、tool、guardrail 的 trace。 LangSmith Evaluation:数据集、实验、trace 与评测。 AgentBench:多环境 Agent benchmark。 SWE bench:真实 GitHub issue 修复评测。 OWASP TAgent Eval:数据集、指标与回归测试Agent Eval:数据集、指标与回归测试 Demo 只能证明某一次路径可能成功,Eval 才能估计系统在任务分布上的可靠性。评测对象是完整 Agent 系统,包括模型、prompt、工具、检索、状态、权限和 Harness。 1. 任务集 每个 case 至少包含: 覆盖正常任务、边界、工具失败、空检索、权限确认、长上下文、取消和恢复。真实线上失败应脱敏后回灌回归集。 2. 指标 task success / pass@1; det可观测性:Trace、Metrics、Logs 与故障定位可观测性:Trace、Metrics、Logs 与故障定位 1. 三类信号 Trace :一次任务的因果链,适合定位哪一步失败; Metrics :跨任务聚合趋势,适合监控成功率、延迟、成本; Logs :详细事件与诊断信息,适合搜索异常。 三者用统一 trace id/run id/turn id/tool call id 关联。 2. Span 层级 每个 span 记录状态、耗时、错误分类和必要元数据。Prompt、工具结果可能含Prompt Injection、权限边界与 Human-in-the-loopPrompt Injection、权限边界与 Human in the loop 1. Prompt Injection Agent 读取网页、邮件、文档和工具输出时,内容中可能包含试图改变系统目标的指令。防护原则: 外部内容是 data,不是 instruction; 系统规则、用户目标和外部数据分层; 工具和资源按最小权限暴露; 敏感数据不进入不必要上下文; 写/发/删等动作经过确定性策略; 最终动作参数在执行前重新校验。 仅在 sAgent Benchmark Map:测量对象、环境、信号与限制Agent Benchmark Map:测量对象、环境、信号与限制 Freshness metadata last verified : 2026 08 24 version scope : benchmark definitions verified 2026 08 24 source type : official benchmark + primary paper stability : version sensitive BenEvaluation 闭环、Trace 与发布门Evaluation 闭环、Trace 与发布门 Freshness metadata last verified : 2026 08 24 version scope : stable evaluation architecture source type : engineering synthesis stability : stable concept 最小数据模型 Dataset:带版本的 case 集合; Task:goal、