← 返回重点项目
02

Session-EvalAgent 质量判断体系

让 Benchmark 与真实用户 Session 共同进入可筛选、可回放、可复核的 Agent 质量闭环。

角色边界:产品主导|联合建设评测标准与校准机制

Benchmark真实 SessionAgent TraceRubricLLM JudgeHuman Review
1 万+ / 天线上完整用户 Session
约 500 / 天11 信号初筛后的待评队列
当前状态
已上线真实 Session 筛选、回放、下载与 LLM-as-a-Judge 初判已上线5 维 19 Check 与证据约束已上线逐 Check 翻转与规则汇总重算

01|双轨评测与真实 Session

Benchmark 比较固定任务与版本产物;真实 Session 补足需求、上下文、工具执行、多轮修改和交付中的过程问题。

线上日均 1 万+ 指完整用户 Session,即同一创作项目中的多轮过程。

Agent Eval 评测闭环
Agent Eval 评测闭环示意图上方是一个按真实量级收敛的垂直漏斗:入口为日均 1 万条以上完整用户 Session,中段由 11 个信号初筛,出口为约 500 条每天的待评队列,收敛比约 20 比 1。队列向下进入五步链路:TRACE 完整 Session、RUBRIC 5 个维度 19 条 Check、EVIDENCE 定位判断依据、JUDGE 逐项判断、HUMAN 复核与校准。HUMAN 之后有一条回边绕过整张图底部与左侧,指回漏斗顶部入口,表示结构化标注回流 Benchmark,为后续 Agent 版本验证提供输入。01 / 流量进入TRAFFIC10,000+ / DAYSCREEN11 个信号初筛QUEUE~500 / DAY02 / 深度评测TRACE完整 SessionRUBRIC5 维度 / 19 CheckEVIDENCE定位判断依据JUDGE逐项判断HUMAN复核与校准03 / 结果回流结构化标注回流 Benchmark

漏斗按真实量级绘制:11 个信号把日均 1 万+ 完整用户 Session 收敛为约 500 条/天的待评队列,初筛只建立队列,不直接给出质量结论。末端的结构化标注回流 Benchmark,为后续 Agent 版本验证提供输入——这是一个闭环,不是单向流程。

02|工作台如何支持复核

MiniMax Hub 产研团队可以组合筛选、完整回放并下载目标数据,再对 Judge 判断进行人工复核与校准;对话、工具调用、素材和产物保持在同一轨迹。

效率信号用于问题定位,不属于过程质量 Rubric。

FILTER组合筛选
REPLAY完整过程回放
DOWNLOAD下载目标数据
REVIEW人工复核/校准
真实脱敏截图|点击索引查看对应区域点击图片放大
延伸研究 / DEEPSEEK HARNESS

DeepSeek Harness 真实 Session 评测

这条 Session 有 54 个用户轮次。Judge 找到了目标漂移,Evidence 也准确指向相关行为,但最终分数仍然低估了实际影响。

03|Agent-Eval 的核心

评测关注用户意图和约束能否稳定进入最终交付,并在失败或修改后继续朝目标收敛。

5 个维度将“意图是否兑现”拆成可定位故障;19 条 Check 各自只判断一个故障信号,并要求证据回到原始 Session。

Rubric 设计目标评测意图兑现的全过程

用户目标会穿过素材与上下文、Agent 编排、工具与子任务、多轮修改和最终交付;过程 Rubric 让每一步都能被回看、判断与复核。

01 / INTENT用户目标与约束02 / HARNESSAgent 编排与执行03 / ITERATION多轮修改与失败处理04 / DELIVERY交付与遗留风险
为什么不只看最终产物或总分?

一次结果看似成立,仍无法说明用户意图和关键约束是否被稳定承接。

一次总分

只能知道表现高低,难以定位问题、稳定归因或指导修复。

逐 Check + Evidence

回到原始 Session,判断哪一轮、哪次执行或哪项交付没有兑现目标。

行业参照:多步工具型 Agent 通常同时关注任务轨迹、工具执行与可验证结果;MiniMax Hub 的维度、Check 与证据规则来自实际评测体系。

用户主张故障 Check成对 EvidenceJudge 命中/N/A
当前 Check · 如何判断

核心目标理解错

用户目标在承接阶段被替换。

用户主张

只替换主角服装,保留原镜头。

Agent 行为/交付

Agent 新建图片任务,未进入视频编辑。

判定边界

目标对象被换掉即命中。

04|结果

Judge 初判经人工复核与校准,再按规则汇总结果;结构化标注回流 Benchmark,支持后续版本验证。

验证依据包括完整轨迹、逐 Check 证据定位与人工校准,不只看 Judge 分数。