你好,我是尹承修。
我专注于 Agent 产品体验,和真实任务的 Session Eval。
SELECTED WORK / 01
重点项目
选择一个词,查看它在哪些项目中被实践
AGENT SYSTEMS
RUNTIME & CONTROL
EVALUATION & OBSERVABILITY
GENERATIVE AI & CREATION
AI DELIVERY & GOVERNANCE
MiniMax HubAgent Harness 工作体验
把复杂多模态 Agent 的执行边界转成用户能够判断、确认、修改并在失败后继续的创作过程。
进入案例 ↗Session-EvalAgent 质量判断体系让 Benchmark 与真实用户 Session 共同进入可筛选、可回放、可复核的 Agent 质量闭环。
进入案例 ↗多模态内容创作Agent 可调用的创作能力把 20+ 前沿生成式模型 API 产品化为 Agent 可调用、用户可继续编辑的创作能力。
进入案例 ↗AI-Native 产品迭代从不确定判断到高效协作先判断需求的不确定性,方向未定时先用可比较原型验证,再进入项目级约束下的实现与验收。
进入案例 ↗MORE WORK / 03
一些作品
01NeurIPS 2024 · CREATIVE AI02Agent Evaluation · Personal Research03Agent Tooling · Open Source04Industry Analysis · Reading Note
RECITYGEN APP
集成 Diffusion 与 Segment Anything Model 的生成式 AI 设计软件,支持自然语言和可视化标记驱动方案生成与编辑。
DeepSeek Harness 真实 Session 评测
通过 50 条合成 Session 与一条真实长程 Trace,检查评测工作台和现有 Rubric 对 coding-agent 的适用边界。
DeepSeek Harness 插件发现站
对 dsh-plugin 生态做全量普查、质量评分与功能聚类,用一句话描述需求即可获得可解释的插件推荐。
从 MiniMax 2026 中报看 AI 产品的价值逻辑
以一份公开中报为切口,拆解模型能力、Agent Harness 与产品交互层的分工,以及评测与数据回流如何构成正向闭环。