DU MU CHONG / AGENT PRODUCT
把 AI 接到研发流程里,让日常重复的事被自动化。
六年游戏测试与质量体系,近年专注把 Agent / LLM 接进研发流程;先看数据拿不拿得到,再看是不是天天在做,最后才决定做不做。
DU MU CHONG / AGENT PRODUCT
六年游戏测试与质量体系,近年专注把 Agent / LLM 接进研发流程;先看数据拿不拿得到,再看是不是天天在做,最后才决定做不做。
我目前在腾讯 IEG 魔方工作室群,负责《暗区突围》局内玩法方向测试,同时带工作室 AI 测试平台的产品定义、优先级判断与验收标准。
查看精选项目 →先减少不必要的选择,再考虑增加新的功能。
三个内部平台,做法和效果都摆在明面上;选择标准是先问数据、再问重复频率、最后看团队能不能直接忽略错的那个。
01 / 研发流程 · AI Agent
测试同学每个需求 / 修复单都要人工翻提交记录判断影响面、再手写分析。把它做成 TAPD → 代码 → 建议 → 企微 的端到端流水线;底层沉淀 21 个技能包与 20 条命令,其他项目可自取组合。
02 / 测试平台 · 数据驱动
把玩法测试同学的工作收成一条流水线:从 TAPD 拉提交、导入 UE 资产,到玩法画像、配置查询、统合比对、用例评审、疑难复现。每条测试点必须引用具体修改项,缺依据不落库。
03 / AI 辅助 · 用例设计
测试同学在思维导图里写用例,AI 只针对当前节点给下一步建议;一个快捷键采纳,不想要继续打字即可。立项时把命题定为「把拒绝成本降到零」,并把采纳率、编辑距离、试点周活定成验收门禁,不达标不合版。
把蓝图、数据表、UI 树、材质、依赖关系批量文本化;让此前 AI 读不到的约 70% 业务逻辑变成可读输入,支撑 40 万+ 资产节点项目里的玩法比对与谱系分析。上一平台的天花板就在数据层,先修数据再调模型。
做的不是单点工具,是一整套「先问数据、再问重复、最后看团队能不能直接忽略错的那个」的产品判断与工程化能力。
结合用户任务、场景与业务约束,定义要解决的问题与优先级。立项时同步把指标与防 gaming 机制想清楚,再写第一行 PRD。
做 LLM 应用、RAG 与混合检索、Agent 工具调用、离线评测与效果门禁;不只关心 prompt,先看数据层能否支撑结论。
用 Python / FastAPI / React / Docker 把能力落到团队能自取的程度。共性能力沉淀成脚手架,其他项目组可复用。
从版本准入、风险研判到自动化性能、平台送审,定义清楚阻塞缺陷解决时长、缺陷重开率、模块缺陷密度等口径。
比起工具本身,我更关心它解决的是不是真问题,以及做出来后团队能不能顺利用起来。
如何开始一个项目先理解正在完成的任务、现有流程和限制;再决定该接什么、什么时候接、接多深。拒绝成本是设计上的硬指标。
如何把工具推到团队把验收口径前置、共性能力沉淀成脚手架、评估门禁写进版本合并条件;不达标就不合版,让「做对的事」比「把事做完」更容易。
这些工具就是我和组里每天在用的活,需求真不真自己有数。短板也很清楚:内部平台没做过大规模对照实验,这是我想在下一份工作补的。
理解用户任务与业务目标
梳理信息、流程与优先级
用原型验证关键方案
补齐状态、规则与交付细节
从一线测试到 AI 平台产品负责人;六年间积累的判断力,是把抽象需求落到可被验收的工程化方案上。
基于 UE4 的撤离射击品类,全球发行、手游与端游双线并行。本职负责局内玩法方向测试管理,同时主导工作室内部 AI 测试平台的产品定义、优先级判断与验收标准制定。保障 9 个版本发布、线上质量事故 0 起。
Unity 多人合作买断制平台跳跃解谜游戏,已上架 Steam 新品节。作为项目首位 QA,从零建立涵盖功能、场景、性能、兼容性的测试体系;带 11 人 QA 团队,主导 PS5 / Switch 送审(PS5 成功送审并获版号),搭建基于蓝盾的版本机与出包流水线。
Unity 1 亿 DAU 竞技射击游戏,风靡东南亚与南美市场。负责模式与局内道具测试,参与玩法性与机制平衡性评估;用 Gautomator 验证武器伤害与有效伤害距离;用 UPR / PerfDog 做性能跟踪,协助程序用 Frida 框架完成反外挂修复校验。