02
Session-EvalAgent 质量判断体系
让 Benchmark 与真实用户 Session 共同进入可筛选、可回放、可复核的 Agent 质量闭环。
从 0 到 1 主导产品方案、数据与评审工作流、信息架构和关键交互,并完成大部分前端与交互实现;与评测、算法、研发联合建设标准与接入。我的职责
Benchmark 负责重点任务与版本产物比较,真实 Session 负责问题发现与过程归因;让 Judge 逐项判断,人工校准边界,再按规则汇总结果。核心判断
把真实用户的完整创作过程沉淀为可组合筛选、回放、下载、复核与结构化回流的评测资产。体系产出
01|双轨评测与真实 Session
Benchmark 比较重点任务、固定输入和版本最终产物;真实 Session 补足真实需求、上下文、工具执行、多轮修改与最终交付中的过程问题。
日均 1 万+ 是完整用户 Session 总量。一个 Session 是同一创作项目中的完整多轮过程,而不是单条 Prompt 或最后一句回答。
初筛只建立待评队列,不直接给出质量结论。
02|工作台如何支持复核
MiniMax Hub 产研团队可以组合筛选、完整回放、下载目标数据,再对 Judge 判断进行人工复核与校准;对话、任务、工具调用、素材和多媒体产物保持在同一创作过程里。
效率信号用于发现和定位问题,不属于过程质量 Rubric。
真实脱敏截图|点击索引查看对应区域点击图片放大
03|Agent-Eval 的核心
评测 Agent 最重要的效果,不是某次产物看起来好不好,而是它能否把用户意图和约束稳定承接到最终交付:做对对象、保留关键要求,并在失败或修改后继续朝目标收敛。
因此,Rubric 不是把过程拆成更多指标,而是把“意图有没有被兑现”拆成 5 类可定位的故障:需求承接、工具与子任务执行、多轮收敛、意图达成,以及挫败与未解决风险。19 条 Check 各自只判断一个故障信号,并要求证据回到原始 Session,才能说明问题发生在哪里、为什么发生,以及最终判断是否成立。
Rubric 设计目标用户意图被稳定兑现
不是只看最后一句回答或产物好不好看,而是把目标承接、工具执行、多轮收敛与最终交付拆成可核验的故障信号。
用户主张→故障 Check→成对 Evidence→Judge 命中/N/A
当前 Check · 如何判断用户主张 Agent 行为/交付
核心目标理解错
用户目标在承接阶段被替换。
只替换主角服装,保留原镜头。
Agent 新建图片任务,未进入视频编辑。
判定边界
目标对象被换掉即命中。
04|结果
将真实用户的完整创作 Session 组织成可筛选、可回放、可复核,并能回到 Benchmark 验证的评测资产。