← 返回重点项目
01

MiniMax HubAgent Harness 工作体验

把复杂多模态 Agent 的执行边界转成用户能够判断、确认、修改并在失败后继续的创作过程。

角色边界:AI 产品经理|主导 Agent 体验语义与关键交互

Agent HarnessPlanningAsk ModeTool UseFailure Recovery用户反馈
当时 49 个工具参数审计范围
6 类 Dock交互抽象
确认/改参/拒绝核心控制点
当前状态
已上线询问模式与关键节点确认已验证字段分级与六类 Dock 方案探索部分精确折叠与后续重构

01|用户为什么会失去控制

MiniMax Hub 面向复杂多模态创作:Agent 调用资产、插件、Skill 与剪辑能力,并把结果组织到画布中继续修改。

早期体验暴露大量工具与系统过程,也会在关键歧义未解决、计划未确认时开始生成,用户难以理解进展或及时调整方向。

01用户看到了什么

工具名、Thinking 和重复更新穿插在主回复中,信息量大但任务进展不清楚。

02为什么是问题

关键歧义尚未解决、计划尚未确认时就开始生成,成本和结果先于用户判断发生。

03缺少什么

不是更多运行细节,而是执行前能够补充信息、检查参数和调整方向的控制点。

02|哪些动作必须把决定权交还用户

我按用户是否需要决策来处理过程信息:后台过程聚合,任务阶段持续可见,关键歧义、高影响动作和失败状态明确打断。

会改变成本、等待时间、生成内容或当前素材的动作,应在执行前让用户补充、改参、确认或拒绝。

CONTROL BOUNDARY

先判断用户是否需要做决定,再决定信息如何出现

01
后台过程无需用户判断
语义聚合

读取、搜索和重复完成事件收纳为任务进度,不逐条占用主回复。

02
任务推进用户需要知道做到哪一步
保持可见

目标、阶段、子任务和主要产物持续显示,让长任务有清楚边界。

03
关键歧义不同选择会改变结果
发起询问

需求仍有关键歧义时先询问,不让 Agent 直接替用户猜测方向。

04
高影响动作影响成本、时长、内容或素材
改参并确认

执行前展示必要参数与输入素材,由用户修改、确认或拒绝。

05
失败/取消用户需要判断如何继续
保留恢复入口

保留影响范围、已有结果和下一步动作,不用一条错误信息结束任务。

03|如何把当时 49 个工具参数变成可判断的选项

我梳理当时 49 个工具的参数与约束,归纳为图片、视频、音乐、语音、编辑与工作流 6 类 Dock。

字段按基础、进阶与系统隐藏分级;比例、分辨率和时长随模型能力约束,用户确认或修改的值覆盖 Agent 提议。

FIELD AUDIT

49 个工具收敛为 6 类用户决策

用户在 Dock 中确认或修改的值覆盖 Agent 提议的初始值。

基础

默认显示,直接影响用户目标、成本、等待时间或主要素材。

进阶

按需展开,为熟悉模型差异的用户保留精细控制。

系统隐藏

由系统注入或仅用于追踪,不要求用户理解和修改。

工具类别默认显示进阶选项用户影响与模型约束
图片生成与参考图编辑提示词/模型/画面比例/分辨率/生成数量随机种子/引导强度/提示词优化模型、分辨率与生成数量共同影响质量、成本和候选范围。可选比例与分辨率必须随模型变化,不能提供模型不支持的组合。
视频文生视频、图生视频与视频编辑提示词/模型/画面比例/分辨率/时长/生成音频多镜头/镜头类型/保留原声时长和音频直接改变价格、等待时间与最终内容,是确认前的高影响字段。不同模型支持固定或离散时长,控件只能提供当前模型的合法值。
音乐歌曲、器乐与翻唱风格/情绪/歌词/参考音频分段结构/演唱方向是否使用歌词、参考音频和具体风格直接决定生成内容。音乐没有画面比例与分辨率,不能机械复用图片或视频字段模板。
语音单条语音与多人对话文本/音色/模型/语速/情绪音高/音量/音色调整/发音词典音色、语速和情绪影响角色表达,多人对话还需要逐行保持文本与音色对应。批量语音必须维持每段文本、音色和情绪的一一对应,不能只提供全局选项。
编辑增强、拼接、配音与对口型输入素材/目标规格/素材顺序/替换/叠加自定义尺寸/配对关系编辑会直接修改或组合已有资产,确认重点是素材、顺序和覆盖方式。没有可解释字段结构的底层通用命令保持后台执行,不强迫用户审核技术参数。
工作流多步骤生成流程工作流/输入项/运行次数预期产物/并发方式输入项与运行次数决定整条流程的执行范围,错误配置会放大到多个步骤。不同工作流的输入结构不同,需要按当前输入项动态组织,不能预设同一套固定字段。

04|Ask Mode 如何进入一次真实任务

Ask Mode 将工具、参数和输入素材整理进 Dock,让用户检查素材、调整参数、确认执行或拒绝调用。

六类 Dock 是脱敏过程 PRD 与交互原型;真实脱敏截图展示询问模式、待确认节点与继续动作如何进入创作任务。

ASK MODE DOCK

同一个确认机制,不能复用同一套参数表

过程 PRD 与交互原型的脱敏重构
已验证的过程方案/交互原型,不连接生成后端。

图片 / 生成与参考图编辑

执行前需要用户判断什么

模型、分辨率与生成数量共同影响质量、成本和候选范围。

可选比例与分辨率必须随模型变化,不能提供模型不支持的组合。
待确认动作图片任务
ASK
提示词Agent 提议值,可由用户调整
模型按当前模型显示合法选项
画面比例按当前模型显示合法选项
分辨率按当前模型显示合法选项
生成数量按当前模型显示合法选项
输入素材

参考图以素材缩略图展示,可核对和移除,不伪装成技术参数。

进阶选项

随机种子/引导强度/提示词优化

拒绝本次调用按当前参数确认
真实脱敏截图|红箭头为公开讲解标注|点击索引查看对应区域点击图片放大

05|确认之后,任务如何继续

确认后,V2 由有状态计划保存阶段、依赖和产物,并以稳定 task id、delta 与局部重试支持任务继续。

画布与资产变化以 diff 回流为上下文。真实任务证明生成、质检、修正和画布更新发生在同一创作过程中,不代表失败恢复已完整上线。

RECOVERY MECHANISM

内部职责只在支撑任务继续时才需要被解释

Agent Harness 从 V1 到 V2 的执行结构
Agent Harness V1 与 V2 执行结构对比图左侧 V1 是单一 media-agent:一个方框内部并列装着意图理解、路径选择、计划组织、工具协调、结果交付五项职责,彼此之间没有连接,全部由同一个角色承担。右侧 V2 是责任链:media-agent 负责意图与交付、router 负责最小路由、planner 负责有状态计划、executor 负责 work item,四个独立方框由箭头依次相连。planner 向下连接到 Stage Execution Plan,executor 有一条回边指回 Stage Execution Plan,表示结果与失败项回流,支撑局部重试与恢复。V1 / SINGLE MEDIA-AGENT一个角色集中组织执行意图理解路径选择计划组织工具协调结果交付V2 / RESPONSIBILITY CHAIN四个角色共同推进任务MEDIA-AGENT意图与交付ROUTER最小路由PLANNER有状态计划EXECUTORwork itemSTAGE EXECUTION PLAN阶段 / 依赖 / 产物的有状态骨架RESULT / RETRY · 只重试失败 work item

V1 把意图、路由、计划、工具与交付集中在单一 media-agent 中,状态依赖上下文维持;V2 拆成四个角色,planner 维护有状态的 Stage Execution Plan,executor 只回报结果与失败项——任务因此可以被修改、恢复和局部推进。

有状态计划Stage Execution Plan

阶段、依赖与产物形成可找回的执行骨架。

修改范围task id + delta

需求变化只更新受影响阶段,保留已完成结果。

失败范围局部重试

只重试失败任务项,不让整条创作链从头开始。

当前对象Canvas diff

画布与资产变化回流为下一轮任务上下文。