模型能力产品化
在海螺 AI,统筹 20+ 生成式模型 API 接入与创作工具落地,处理模型的输入、输出和参数差异,并支持产物继续编辑与复用。
多模态内容创作 →ABOUT ME / 05
本科在中央美术学院学习产品设计时,我开始关注产品的审美与体验,以及人如何理解信息、使用工具和完成任务。从早期的 StyleGAN 实验,到哥大计算机设计硕士阶段的学习,我逐步补充编程、数据处理与 AI 算法,希望亲手验证产品想法,构建面向 AI 时代的更全面的技术能力。进入 AI 产品工作后,我进一步深入模型能力、Agent 执行与真实行为评测,思考如何将这些能力组织成用户能够理解、参与并完成任务的产品,以及新的模型能力还能带来哪些值得探索的体验。

EXPERIENCE
毕业就加入 MiniMax,我看重 AI 产品的发展,也希望在小团队中参与问题定义、方案取舍与落地验证。在海螺 AI 和 MiniMax Hub,我接触了模型接入、创作工具、商业化与 Agent 任务体验。职责的跨度让我有机会理解:一个用户问题,如何牵动模型、工程、设计与业务之间的取舍。
在迭代 Agent 对话体验的过程中,我发现,用户说“结果不符合预期”,背后可能是需求理解偏差、上下文遗漏、工具参数错误,也可能是缺少及时调整方向的机会。仅看界面和最终产物,难以判断该改哪里。我因此推动真实 Session 评测,将用户需求、工具调用与执行结果对应起来,希望为产品改进提供更具体的依据。
在海螺 AI,统筹 20+ 生成式模型 API 接入与创作工具落地,处理模型的输入、输出和参数差异,并支持产物继续编辑与复用。
多模态内容创作 →在 MiniMax Hub,负责任务状态、过程反馈与失败恢复,让用户能够确认关键参数、补充信息,并在失败后继续任务。
Agent Harness →从 0 到 1 主导真实 Session 评测的产品方案、信息架构和关键交互,将问题判断对应到具体对话、工具调用和产物。
Session-Eval →EARLIER WORK
设计训练培养了我的审美判断,也让我习惯从人的使用情境出发,组织视觉、信息、交互与反馈。我会关注功能是否有效,也在意比例、节奏和细节能否形成自然、协调的整体体验。接触生成模型后,我开始面对新的问题:模型如何学习,结果为什么会这样,用户又如何理解和判断这些结果。
为了亲手探索这些问题,我逐步学习数据处理、机器学习与网页实现,将实验结果做成可以操作的原型。选择 AI 产品,是希望继续参与从发现需求、判断能力边界,到设计体验和验证效果的过程。早期研究与设计项目,让我开始同时从用户和技术两侧思考一个方案。
UNDERGRADUATE / ART & PRODUCT DESIGN
本科四年,我持续使用 Rhino、Blender、Adobe Creative Suite、Figma、剪映等工具,熟练完成 3D 建模、视频制作、界面设计与交互原型。这些实践培养了我的审美与表达能力,也让我熟悉不同创作工具的操作逻辑:从平面与界面,到三维资产、空间关系和时间线,理解它们如何共同支持一个创作任务。
这些训练延续到了今天的产品工作中。面对复杂信息,我会关注用户首先需要理解什么;面对多步骤任务,我会考虑用户如何判断当前状态,以及下一步可以采取什么行动。我继续把这种跨媒介经验用于模型能力产品化和 Agent 任务体验。
始于 2021 / GENAI STUDY
观看项目视频 ↗我最初接触生成模型,是想探索机器学习能否辅助古文字的形态比较。项目始于 2021 年,相关探索持续到 2024 年初;我整理小篆与甲骨文资料,并使用 StyleGAN 生成字形。训练中出现过重复字形等问题,我尝试调整训练材料与结构标注。
为了比较生成结果的形态特征与辨识差异,我继续加入人类评测、计算机视觉相似性分析、条件生成和降维可视化。这次 GenAI 启蒙让我意识到:得到看似合理的结果,与判断结果是否有依据,是两件不同的事。
GRADUATE THESIS / TRIEMOJIMAP
Emoji 同时是图像、语言符号和社交媒介;视觉模型、文本 Embedding 与语言模型对同一个 Emoji 的表征并不一致。TriEmojiMap 的目标,是把这些差异转成可以切换和比较的交互界面,帮助非机器学习背景的用户理解“相似”并不是单一标准。
在这个项目中,我独立完成了从数据整理、模型表示实验到交互网页的原型搭建:整理 1,810 个 Emoji,建立视觉、文本语义和语言模型 Token 三个表示层,并将聚类、单点详情与引导叙事组织成交互式网页。
查看 TriEmojiMap ↗NEURIPS 2024 / RECITYGEN
RECITYGEN 集成 Diffusion 与 Segment Anything Model,让参与者通过自然语言和可视化标记提出城市空间改造意见,并查看生成结果。项目关注的不只是生成图像,也包括公众意见如何进入设计流程。
查看论文 · NeurIPS 2024 Creative AI Track ↗HOW I WORK
Agent 的进度、确认和恢复,都需要与实际执行状态对应。我会结合工具调用、上下文和用户操作,判断应该展示什么、何时需要用户介入,以及中断后怎样继续。
推动 Session 评测让我更关注判断之后的行动:哪类用户问题值得优先解决,证据指向哪个环节,修改后如何验证。理解技术机制帮助我提出可能的原因,真实行为则帮助我检查这些判断。
我主导过交互原型方法,将方向未定的需求做成可运行、可比较的方案。接下来,我希望把这种工作方式用于新的模型能力:选择具体场景,验证用户能否完成原来难以完成的事,再判断是否值得继续投入。
BACKGROUND
计算机设计硕士(交叉学科)
产品设计 本科