MiniMax HubAgent Harness 工作体验
把复杂多模态 Agent 的执行边界转成用户能够判断、确认、修改并在失败后继续的创作过程。
角色边界:AI 产品经理|主导 Agent 体验语义与关键交互
01|用户为什么会失去控制
MiniMax Hub 面向复杂多模态创作:Agent 调用资产、插件、Skill 与剪辑能力,并把结果组织到画布中继续修改。
早期体验暴露大量工具与系统过程,也会在关键歧义未解决、计划未确认时开始生成,用户难以理解进展或及时调整方向。
INITIAL
最初暴露
工具参数、思考和系统执行状态直接进入用户视野。
INTERMEDIATE
中间调优
过程已经开始收敛,任务语义仍在继续调整。
CURRENT
最新调整
过程按任务语义聚合,主回复保持连续。
工具名、Thinking 和重复更新穿插在主回复中,信息量大但任务进展不清楚。
关键歧义尚未解决、计划尚未确认时就开始生成,成本和结果先于用户判断发生。
不是更多运行细节,而是执行前能够补充信息、检查参数和调整方向的控制点。
02|哪些动作必须把决定权交还用户
我按用户是否需要决策来处理过程信息:后台过程聚合,任务阶段持续可见,关键歧义、高影响动作和失败状态明确打断。
会改变成本、等待时间、生成内容或当前素材的动作,应在执行前让用户补充、改参、确认或拒绝。
CONTROL BOUNDARY
先判断用户是否需要做决定,再决定信息如何出现
读取、搜索和重复完成事件收纳为任务进度,不逐条占用主回复。
目标、阶段、子任务和主要产物持续显示,让长任务有清楚边界。
需求仍有关键歧义时先询问,不让 Agent 直接替用户猜测方向。
执行前展示必要参数与输入素材,由用户修改、确认或拒绝。
保留影响范围、已有结果和下一步动作,不用一条错误信息结束任务。
03|如何把当时 49 个工具参数变成可判断的选项
我梳理当时 49 个工具的参数与约束,归纳为图片、视频、音乐、语音、编辑与工作流 6 类 Dock。
字段按基础、进阶与系统隐藏分级;比例、分辨率和时长随模型能力约束,用户确认或修改的值覆盖 Agent 提议。
FIELD AUDIT
49 个工具收敛为 6 类用户决策
用户在 Dock 中确认或修改的值覆盖 Agent 提议的初始值。
默认显示,直接影响用户目标、成本、等待时间或主要素材。
按需展开,为熟悉模型差异的用户保留精细控制。
由系统注入或仅用于追踪,不要求用户理解和修改。
| 工具类别 | 默认显示 | 进阶选项 | 用户影响与模型约束 |
|---|---|---|---|
| 图片生成与参考图编辑 | 提示词/模型/画面比例/分辨率/生成数量 | 随机种子/引导强度/提示词优化 | 模型、分辨率与生成数量共同影响质量、成本和候选范围。可选比例与分辨率必须随模型变化,不能提供模型不支持的组合。 |
| 视频文生视频、图生视频与视频编辑 | 提示词/模型/画面比例/分辨率/时长/生成音频 | 多镜头/镜头类型/保留原声 | 时长和音频直接改变价格、等待时间与最终内容,是确认前的高影响字段。不同模型支持固定或离散时长,控件只能提供当前模型的合法值。 |
| 音乐歌曲、器乐与翻唱 | 风格/情绪/歌词/参考音频 | 分段结构/演唱方向 | 是否使用歌词、参考音频和具体风格直接决定生成内容。音乐没有画面比例与分辨率,不能机械复用图片或视频字段模板。 |
| 语音单条语音与多人对话 | 文本/音色/模型/语速/情绪 | 音高/音量/音色调整/发音词典 | 音色、语速和情绪影响角色表达,多人对话还需要逐行保持文本与音色对应。批量语音必须维持每段文本、音色和情绪的一一对应,不能只提供全局选项。 |
| 编辑增强、拼接、配音与对口型 | 输入素材/目标规格/素材顺序/替换/叠加 | 自定义尺寸/配对关系 | 编辑会直接修改或组合已有资产,确认重点是素材、顺序和覆盖方式。没有可解释字段结构的底层通用命令保持后台执行,不强迫用户审核技术参数。 |
| 工作流多步骤生成流程 | 工作流/输入项/运行次数 | 预期产物/并发方式 | 输入项与运行次数决定整条流程的执行范围,错误配置会放大到多个步骤。不同工作流的输入结构不同,需要按当前输入项动态组织,不能预设同一套固定字段。 |
04|Ask Mode 如何进入一次真实任务
Ask Mode 将工具、参数和输入素材整理进 Dock,让用户检查素材、调整参数、确认执行或拒绝调用。
六类 Dock 是脱敏过程 PRD 与交互原型;真实脱敏截图展示询问模式、待确认节点与继续动作如何进入创作任务。
ASK MODE DOCK
同一个确认机制,不能复用同一套参数表
过程 PRD 与交互原型的脱敏重构
已验证的过程方案/交互原型,不连接生成后端。
图片 / 生成与参考图编辑
执行前需要用户判断什么
模型、分辨率与生成数量共同影响质量、成本和候选范围。
可选比例与分辨率必须随模型变化,不能提供模型不支持的组合。参考图以素材缩略图展示,可核对和移除,不伪装成技术参数。
进阶选项
随机种子/引导强度/提示词优化
05|确认之后,任务如何继续
确认后,V2 由有状态计划保存阶段、依赖和产物,并以稳定 task id、delta 与局部重试支持任务继续。
画布与资产变化以 diff 回流为上下文。真实任务证明生成、质检、修正和画布更新发生在同一创作过程中,不代表失败恢复已完整上线。
RECOVERY MECHANISM
内部职责只在支撑任务继续时才需要被解释
V1 把意图、路由、计划、工具与交付集中在单一 media-agent 中,状态依赖上下文维持;V2 拆成四个角色,planner 维护有状态的 Stage Execution Plan,executor 只回报结果与失败项——任务因此可以被修改、恢复和局部推进。
阶段、依赖与产物形成可找回的执行骨架。
需求变化只更新受影响阶段,保留已完成结果。
只重试失败任务项,不让整条创作链从头开始。
画布与资产变化回流为下一轮任务上下文。