先定义能力评估再运行 Agent

先固定通过条件和回归样例,再比较 Agent 工作流是否真的变好。

Prompts 提示词场景 · Agent 工作流与自动化更新 · 2026-09-09

使用判断

适用场景

优化 Agent 提示词、工具链或工作流,需要用结果而不是主观感觉判断收益时使用。

预期结果

得到基线、评估样例、改动后结果和回归差异组成的可比较报告。

Prompt 快速复制

请为 Agent 能力 {{capability}} 建立评估。先定义成功标准、代表性样例、边界样例、失败样例和评分规则;运行当前基线并记录结果;再执行改动后的版本,逐项比较能力评估和回归评估。没有基线或评分规则时不要宣称优化有效。

使用说明

基于公开 GitHub Prompt 结构的中文原创改写,保留原始出处,不等同于原仓库官方内容。

出处