评测、可观测性与安全推荐阅读
- OpenAI Evals:可复现 eval 任务与评估框架。
- OpenAI Agents SDK Tracing:Agent、handoff、tool、guardrail 的 trace。
- LangSmith Evaluation:数据集、实验、trace 与评测。
- AgentBench:多环境 Agent benchmark。
- SWE-bench:真实 GitHub issue 修复评测。
- OWASP Top 10 for LLM Applications:Prompt Injection、敏感信息和代理风险分类。
建议产出:至少 20 条固定 case 的 eval 表,记录期望、实际、失败分类、trace、成本和延迟,并接入回归执行。