先定义能力评估再运行 Agent
先固定通过条件和回归样例,再比较 Agent 工作流是否真的变好。
使用判断
适用场景
优化 Agent 提示词、工具链或工作流,需要用结果而不是主观感觉判断收益时使用。
预期结果
得到基线、评估样例、改动后结果和回归差异组成的可比较报告。
Prompt 快速复制
请为 Agent 能力 {{capability}} 建立评估。先定义成功标准、代表性样例、边界样例、失败样例和评分规则;运行当前基线并记录结果;再执行改动后的版本,逐项比较能力评估和回归评估。没有基线或评分规则时不要宣称优化有效。使用说明
基于公开 GitHub Prompt 结构的中文原创改写,保留原始出处,不等同于原仓库官方内容。