跳转到正文
返回关于

多语言翻译质量系统

翻译三阶段 Agent、剧名 RM / RL 与质量闭环建设

围绕剧名与视频字幕翻译,建设从生成、诊断、定向修复到人工反馈和训练数据回流的多语言质量系统。

三阶段 Translation Agent多语种路由CPS / 术语 / 行协议LLM 多维评估Reward Model / RL候选排序主动反馈回归评测

以下为作者提供的脱敏项目记录,结果尚未经独立复核。

项目背景

业务需要把中文或英文内容持续交付到多个目标语种。剧名翻译既要忠实剧情,又要符合当地市场的表达和传播习惯;字幕翻译除语义准确外,还受到字幕 ID 对齐、术语一致性、阅读速度、标点与语区规范等约束。直接调用模型得到单次译文后,质量问题主要依赖译员逐条发现和修改,问题类型、最终采用结果与模型版本之间也缺少稳定关联。因此,项目分别建设字幕三阶段 Agent 和剧名候选选择链路,并以译员反馈、实际采用数据和人工修改结果构成统一的数据闭环。

方案与系统链路

  1. 字幕翻译:原文字幕、时间轴与术语 → 语种路由和上下文增强 → 第一阶段初译 → 第二阶段反思诊断 → 第三阶段定向改进 → 程序质检与语区后处理 → 交付译文。
  2. 剧名翻译:原剧名、剧情简介与市场要求 → 多策略候选生成 → 长度和硬性风险过滤 → LLM 多维评分 / RM 评估 → 加权排序与人工采用 → 实际剧名记录。
  3. 工程保障:统一行协议与字幕 ID → CPS、术语及文字泄漏检查 → 主备模型切换与失败降级 → 分阶段日志、Token 和修正记录 → 按语种独立配置与迭代。
  4. 质量闭环:主动收集译员问题反馈、剧名采用率、实际采用剧名、字幕单行修改率和整集无修改率 → 错误分类与样本清洗 → 回归集、RM / RL 数据和 Prompt 样本 → 新版本离线评估与线上反馈。

我的负责范围

  • 在既有字幕初译链路中引入“初译—反思—改进”三阶段 Agent:由反思阶段定位错译、漏译、术语、字幕错位、CPS 和语区表达问题,再由改进阶段只修复问题行。
  • 设计剧名多候选生成、硬性质量过滤、LLM 多维度打分和加权选择流程;使用人工偏好与实际采用数据构建奖励模型,并将奖励信号用于 RL 迭代候选生成和排序。
  • 建设主动反馈与数据回流流程,关联译员问题、最终人工版本、实际采用剧名、语种、模型和策略版本,将生产反馈整理为评估、训练及回归样本。
  • 建立剧名采用率、字幕单行修改率、整集无修改率与严重错误分类等指标,按语种持续比较 Agent、Prompt、规则、RM 和 RL 版本的效果。

字幕三阶段 Agent 与定向问题修复

字幕链路的核心改动,是把一次性翻译拆成职责清晰的三个阶段。第一阶段根据源字幕、上下文、术语和目标语种要求完成初译;第二阶段同时读取原文与初译,按语义、漏译、字幕行对应、术语、CPS 和语区表达等维度输出问题诊断;第三阶段接收诊断结果,只返回需要修改的字幕行,并按 index 合并回原译文。没有发现问题时可以跳过改进阶段,避免为了“润色”而改坏已经正确的内容。

Agent 前后保留程序化保障:术语在翻译前匹配并贯穿诊断与修正,统一行协议保护字幕 ID,CPS 和语区规则负责低成本快速检查,目标语种后处理再统一标点和格式。各阶段支持主备模型切换;反思或改进失败时降级保留初译,不让附加质量环节扩大服务故障。分阶段元数据记录是否调用反思、是否执行改进、修正行数、模型尝试和 Token,为后续定位问题与成本评估提供依据。

剧名候选、奖励模型与强化学习

剧名不是对原文做一次字面翻译,而是候选生成与选择问题。系统结合原剧名、剧情简介和目标市场要求,从不同策略生成多个候选,再做去重、长度控制和硬性风险过滤。通过语义忠实度、目标语自然度、题材与市场匹配、吸引力、辨识度及完整性安全等维度进行 LLM 评分,由程序复算加权结果并输出排序,保留候选、分项依据和最终选择记录。

在第一版多候选与 LLM 加权评分基础上,将译员选择、实际采用剧名及相关人工偏好整理为训练数据,构建奖励模型(RM)学习业务对好剧名的判断。RM 既参与候选评估,也为强化学习(RL)提供奖励信号,用于继续优化候选生成和排序,使模型不只复现表面措辞,而是逐步学习不同语种和市场中的采用偏好。整条链路保留人工决策出口,并以真实采用结果检验模型评分是否与生产选择一致。

译员反馈与生产数据闭环

反馈流程不只等待最终译文,而是主动收集译员在生产中遇到的问题,并记录问题字幕、错误类型、严重程度、修改前后文本和处理意见。剧名侧同时保存系统候选、推荐结果、是否采用以及最终实际采用的剧名;字幕侧保存单行修改结果和整集是否无需修改。数据通过任务、语种、模型、Prompt、Agent 与规则版本关联,使一次人工修改可以追溯到产生它的具体策略。

回流时先清洗敏感信息和无效修改,再把高风险错译、漏译、人物关系、数字、术语、字幕错位、CPS 和表达问题分别沉淀为回归样本。剧名选择与采用记录用于 RM / RL 和候选排序,字幕修改对用于诊断 Prompt、定向修复和语种规则迭代;整集无修改样本则用于检查新版本是否破坏已经稳定的案例。新策略先离线回放,再结合后续生产指标决定是否继续使用。

评估口径与持续迭代

剧名侧以候选可用性、推荐采用率和实际采用结果观察模型是否真正支持生产决策;字幕侧以单行修改率衡量人工返工量,以整集无修改率衡量可直接交付的完整剧集比例。同时保留严重错译、漏译、术语错误和字幕错位等分类指标,避免少量高风险错误被较低的字符修改量掩盖。

指标按语种和版本拆分,用同一批样本比较直接翻译、三阶段 Agent、Prompt 调整、程序规则和模型训练版本。失败案例进入固定回归集,修改 Prompt、规则、RM 或 RL 策略后重新测试,并检查其他语种和错误类型是否退化,从而把零散人工经验转化为可以重复验证的优化过程。

可公开结果

  • 剧名翻译第一版采用多候选生成与 LLM 加权评分,线上采用率为 42%。
  • 引入 RM 后采用率提升至 70%;持续迭代后,部分语种超过 85%,平均约 75%。
  • RM 与 RL 迭代后,候选生成获得更多可用剧名,多样性提升、重复率降低,并以实际采用剧名持续校正奖励与排序。
  • 引入字幕三阶段 Agent 后,已有阶段性统计的阿拉伯语、印地语、日语、葡萄牙语和土耳其语单行字符修改率均较直接翻译下降;该指标用于衡量返工量,并与严重错误分类共同使用。
  • 形成覆盖译员问题、剧名采用、实际采用剧名、字幕单行修改和整集无修改结果的数据闭环,用于 Prompt、规则、Agent、RM 与 RL 的持续回归和优化。

关联公开内容