2026.4 – 2026.7 · 北京
腾讯 · 混元
AI 产品工程师
秉持为模型设计产品的理念,基于 hy-mt2.0 翻译模型 0-1 孵化腾讯 Hy 翻译,覆盖小程序、iOS、安卓三端,支持在线与端侧离线翻译,涵盖文本、语音、拍照、同传等场景。除产品设计外,我还负责模型效果这条线:从 0 搭建翻译评测集与评测机制,并建立 Case 收集 → 产品评测 → 算法迭代的闭环,用真实数据反哺模型迭代。其中我最投入的是拍照翻译,通过多款竞品横评与国内外用户调研,锁定离线、免费、大模型场景化的差异化切入点并推动其作为 P0 落地。
0→1翻译产品多端上线26%→60%反馈 badcase 解决率0-1 搭建模型评测体系
我负责什么
独立负责 Hy 翻译产品的 0-1 产品设计、模型评测体系搭建与 badcase 驱动的模型优化,并推动研发上线。
产品设计(0→1)
- 系统调研翻译类与 AI 类产品,用 vibe coding 产出文本、语音、拍照、同传及浏览器扩展等功能。
- 拍照翻译上做了多款竞品的多维横评与小红书、Reddit 用户调研,锁定离线、免费、场景化 AI 的差异化定位并推动作为 P0 落地。
- 推动小程序 / iOS / 安卓多端(在线 + 离线)上线,让模型能力真正触达用户。
模型评测体系(0→1)
- 从 0 搭建翻译评估维度体系:按语种对(主打语对 + 长尾)、输入长度、使用场景、翻译偏好、指令遵循等维度分层设计评测集,兼顾覆盖面与主打场景。
- 用 DCG 对新老模型逐条打分做横向对比;错误按 P0 / P1 / P2 分级,区分是否需要优化与错误归因,个性化未遵循再细分为风格、术语、格式,保证多人评测口径一致。
模型优化(badcase 驱动)
- 以 badcase 驱动、按归因分层给出解法:高频术语 / 网络语走自建术语库 + 术语干预,方言类在 prompt 中注入源语种,复杂问题提供 GT 交算法做定向蒸馏优化。
- 反馈 badcase 解决率随迭代从约 26% 提升到 60%。
我的思考
这段经历让我真正理解了模型能力的边界,也让我相信好的 AI 产品,是把模型能力翻译成用户能感知的价值。
下一段经历
字节跳动 · Flow