Session-EvalAgent 质量判断体系
让 Benchmark 与真实用户 Session 共同进入可筛选、可回放、可复核的 Agent 质量闭环。
角色边界:产品主导|联合建设评测标准与校准机制
01|双轨评测与真实 Session
Benchmark 比较固定任务与版本产物;真实 Session 补足需求、上下文、工具执行、多轮修改和交付中的过程问题。
线上日均 1 万+ 指完整用户 Session,即同一创作项目中的多轮过程。
漏斗按真实量级绘制:11 个信号把日均 1 万+ 完整用户 Session 收敛为约 500 条/天的待评队列,初筛只建立队列,不直接给出质量结论。末端的结构化标注回流 Benchmark,为后续 Agent 版本验证提供输入——这是一个闭环,不是单向流程。
02|工作台如何支持复核
MiniMax Hub 产研团队可以组合筛选、完整回放并下载目标数据,再对 Judge 判断进行人工复核与校准;对话、工具调用、素材和产物保持在同一轨迹。
效率信号用于问题定位,不属于过程质量 Rubric。
DeepSeek Harness 真实 Session 评测
这条 Session 有 54 个用户轮次。Judge 找到了目标漂移,Evidence 也准确指向相关行为,但最终分数仍然低估了实际影响。
03|Agent-Eval 的核心
评测关注用户意图和约束能否稳定进入最终交付,并在失败或修改后继续朝目标收敛。
5 个维度将“意图是否兑现”拆成可定位故障;19 条 Check 各自只判断一个故障信号,并要求证据回到原始 Session。
用户目标会穿过素材与上下文、Agent 编排、工具与子任务、多轮修改和最终交付;过程 Rubric 让每一步都能被回看、判断与复核。
一次结果看似成立,仍无法说明用户意图和关键约束是否被稳定承接。
只能知道表现高低,难以定位问题、稳定归因或指导修复。
回到原始 Session,判断哪一轮、哪次执行或哪项交付没有兑现目标。
行业参照:多步工具型 Agent 通常同时关注任务轨迹、工具执行与可验证结果;MiniMax Hub 的维度、Check 与证据规则来自实际评测体系。
核心目标理解错
用户目标在承接阶段被替换。
只替换主角服装,保留原镜头。
Agent 新建图片任务,未进入视频编辑。
目标对象被换掉即命中。
04|结果
Judge 初判经人工复核与校准,再按规则汇总结果;结构化标注回流 Benchmark,支持后续版本验证。
验证依据包括完整轨迹、逐 Check 证据定位与人工校准,不只看 Judge 分数。