← 返回重点项目
02

Session-EvalAgent 质量判断体系

让 Benchmark 与真实用户 Session 共同进入可筛选、可回放、可复核的 Agent 质量闭环。

Benchmark真实 SessionAgent TraceRubricLLM JudgeHuman Review
从 0 到 1 主导产品方案、数据与评审工作流、信息架构和关键交互,并完成大部分前端与交互实现;与评测、算法、研发联合建设标准与接入。我的职责
Benchmark 负责重点任务与版本产物比较,真实 Session 负责问题发现与过程归因;让 Judge 逐项判断,人工校准边界,再按规则汇总结果。核心判断
把真实用户的完整创作过程沉淀为可组合筛选、回放、下载、复核与结构化回流的评测资产。体系产出

01|双轨评测与真实 Session

Benchmark 比较重点任务、固定输入和版本最终产物;真实 Session 补足真实需求、上下文、工具执行、多轮修改与最终交付中的过程问题。

日均 1 万+ 是完整用户 Session 总量。一个 Session 是同一创作项目中的完整多轮过程,而不是单条 Prompt 或最后一句回答。

01 / 流量进入
TRAFFIC日均 1 万+ 完整用户 Session
SCREEN11 个信号初筛
QUEUE约 500 条/天待评队列

初筛只建立待评队列,不直接给出质量结论。

02 / 深度评测
TRACE完整 Session
RUBRIC5 个维度 · 19 条 Check
EVIDENCE定位判断依据
JUDGE逐项判断
HUMAN复核与校准
03 / 结果回流
RESULT按规则汇总已确认结果
RETURN结构化标注回流 Benchmark
ITERATE支持 Agent 版本验证

02|工作台如何支持复核

MiniMax Hub 产研团队可以组合筛选、完整回放、下载目标数据,再对 Judge 判断进行人工复核与校准;对话、任务、工具调用、素材和多媒体产物保持在同一创作过程里。

效率信号用于发现和定位问题,不属于过程质量 Rubric。

FILTER组合筛选
REPLAY完整过程回放
DOWNLOAD下载目标数据
REVIEW人工复核/校准
真实脱敏截图|点击索引查看对应区域点击图片放大

03|Agent-Eval 的核心

评测 Agent 最重要的效果,不是某次产物看起来好不好,而是它能否把用户意图和约束稳定承接到最终交付:做对对象、保留关键要求,并在失败或修改后继续朝目标收敛。

因此,Rubric 不是把过程拆成更多指标,而是把“意图有没有被兑现”拆成 5 类可定位的故障:需求承接、工具与子任务执行、多轮收敛、意图达成,以及挫败与未解决风险。19 条 Check 各自只判断一个故障信号,并要求证据回到原始 Session,才能说明问题发生在哪里、为什么发生,以及最终判断是否成立。

Rubric 设计目标用户意图被稳定兑现

不是只看最后一句回答或产物好不好看,而是把目标承接、工具执行、多轮收敛与最终交付拆成可核验的故障信号。

用户主张故障 Check成对 EvidenceJudge 命中/N/A
当前 Check · 如何判断

核心目标理解错

用户目标在承接阶段被替换。

用户主张

只替换主角服装,保留原镜头。

Agent 行为/交付

Agent 新建图片任务,未进入视频编辑。

判定边界

目标对象被换掉即命中。

04|结果

将真实用户的完整创作 Session 组织成可筛选、可回放、可复核,并能回到 Benchmark 验证的评测资产。