记录 Execution Trajectory
保留计划、Context、模型与工具调用、状态、人工判断和最终结果,形成完整运行证据。
企业级保障 · Agent Reliability & Evaluation
让每一次运行可观察、可评测,也推动下一次改进。
记录完整执行过程,让生产观测中发现的真实失败回到评测集、Evaluator 与回归门槛,形成“构建 → 运行 → 观测 → 改进”闭环,让每次升级都能被验证。
运行机制
评测维度不应只由预设基准产生,也要从完整 Execution Trajectory 中持续发现新失败,再由领域专家建立判据并校准自动评估。
保留计划、Context、模型与工具调用、状态、人工判断和最终结果,形成完整运行证据。
从真实运行记录中发现异常,合并为失败维度,并由领域专家建立判据与黄金样例。
用人工判定的黄金样例对齐自动评估,对机器无法稳定判断的新型或主观失败保留人工复核。
模型、Context、Skills 或系统变更后重跑关键任务,只有通过门槛的改进才能进入生产。
企业价值
把关键任务、失败条件与人工复核标准转化为可重复的上线检查,而不是依赖演示效果。
通过 Execution Trajectory 区分模型、Context、Agent Harness、Skill、工具或流程问题,缩短排查与修复路径。
基础模型、Skills 或系统变化后回归关键任务,确认改进不是以其他能力退化为代价。
验证与边界
自动评测可以扩大覆盖,但新的失败类型、主观质量和高风险结果仍需要领域专家定义标准、校准 Evaluator 并保留责任边界。业务结果用于验证评测是否真正代表价值,而不是替代专业判断。
衡量方式
任务级成功率
Evaluator 与人工一致性
关键任务回归通过率
失败恢复成功率
边界与护栏
区分模型输出、步骤正确性、任务完成与业务结果,避免单一指标替代完整判断。
由领域专家建立黄金样例、处理新失败类型,并复核高风险或主观结果。
清楚区分已运行的数据回流与人工迭代,以及仍在持续工程化的自动评测能力。
技术问题
离线评测用于稳定复现关键任务与已知失败,线上结果则检验系统在真实环境中的完成质量和业务影响。两者需要通过同一任务定义与运行记录关联,避免离线分数提高却没有带来真实改进。
先基于完整运行记录确认失败原因和责任边界,再由领域专家整理为可复现任务、期望行为与判定标准。案例应按场景和版本管理,进入后续模型、Skills、Context 与流程变更的回归测试。
需要固定任务定义、Context 快照、工具环境和判定标准,并同时记录质量、成本、时延、人工介入与失败恢复。只有在相同条件下完成多次运行,才能区分稳定改进与偶然成功。