多模态内容创作可控、可编辑的生成体验
把 20+ 前沿生成式模型能力组织成连续、可控、可编辑的创作任务。
01|为什么模型能力需要产品化
内容创作者需要的不是更多模型入口,而是能够从生成、选择、修改到继续创作的稳定路径。不同模型的参数、输入输出和编辑方式差异很大,直接暴露 API 会把学习成本留给用户。
我的任务是统筹生成能力的交互规划与接口联调,将底层模型能力转成可控、可编辑的创作工具。
02|模型能力如何变成创作路径
不同模型的输入输出和参数差异,使用户难以判断该选择哪种能力、如何继续编辑,以及如何把多个结果组织成一条创作路径。
核心矛盾是生成自由度与创作控制感:一次性好看的结果不等于可用的生产工具。
图像、视频、增强和编辑模型提供不同输入输出能力。
Agent 决定调用什么能力,并把资产、约束和结果连成一条任务链。
生成结果进入选择、编辑与资产编排,而不是一次性下载终点。
03|按创作动作组织能力

围绕多宫格分镜、全视角工坊、光影工作室、海螺 Agent、创作视频、创作图片、创作语音与创作音乐等真实工具入口组织能力,而不是把模型名称直接堆给用户。
将输入、生成、预览、编辑和下一步动作组织为连续路径,让结果能够被继续修改和复用。
按模型名称堆入口,把参数理解和模型选择成本留给创作者。
按生成、增强、编辑与编排组织任务,并由 Agent 承接资产上下文。
用户目标是完成内容,不是学习底层模型目录。
04|连续创作如何验证
用真实素材、交互原型和端到端调用验证模型限制,再通过 PE 调试与快速前端实现检查资产引用、节点定位、等待反馈和失败恢复。
05|能力矩阵与工具证据

用能力矩阵和工具证据检查不同输入、输出与编辑动作是否被组织成一致的产品路径。
模型输出、输入素材和后续编辑动作必须能被继续复用,才能从单点能力变成连续创作任务。
图像生成
文生图、参考图、角色与场景设定
视频生成
文生视频、图生视频、镜头延展
视频增强
超分、补帧、画质恢复
局部编辑
涂抹重绘、对象替换、区域控制
叙事编排
智能分镜、镜头规划、资产组合
资产编排
引用素材、组合结果、继续创作
06|共同验收标准
同时检查模型输出质量与系统可用性:输入是否有效、等待是否可理解、结果能否继续编辑、失败后是否可恢复、Agent 是否正确承接当前资产上下文。
同时检查输入有效性、生成反馈、继续编辑、结果可复用,以及不同模型能力是否真正服务于当前创作目标。
07|结果与责任边界
形成覆盖模型接入与多模态创作工具的产品经验,并把“可控、可编辑、可继续创作”沉淀为共同验收标准。
Hub 的 Canvas 上下文回流、资产定位和失败恢复属于 Agent Harness 项目,不在本项目中重复归因。