- Authors

- Name
- qiaoshilei
- GitHub1395291968@qq.com
WebNovel Title Localization Lab:把中文网文标题翻成真正适合英语读者的名字
Lab #02 · 持续开发中
这不是一个面向读者的“全文翻译网站”,而是一个可复现的研究实验:如何让中文网文标题在英文市场中既不背离原作,又自然、有类型感,并且足够吸引读者。
一个标题并不只是翻译
把中文网文标题翻成英文,字面翻译往往只是起点。一个可用的英文标题还需要同时满足:是否忠实故事前提、英文是否自然、类型与目标平台是否匹配、是否有读者吸引力,以及是否避免标题党、剧透或虚构事实。
这也是 WebNovel Title Localization Lab 的研究问题:一个针对该任务的排序器,能否利用弱平台信号和少量人工偏好数据,比规则基线或通用 LLM 裁判更稳定地挑出好标题?
从生成到评估的完整流程
项目没有把候选生成和标题排序混在一起。候选集一旦冻结,后续可以在完全相同的候选标题上比较不同排序方法,保证实验结论可复现。
中文网文记录
→ 输入校验与来源追踪
→ 三种策略生成候选标题
→ 硬约束过滤
→ 规则 / LLM / 学习排序
→ 冻结集评估
→ 错误分析与实验报告
当前的两阶段基线会先生成 12 个英文候选标题:4 个从原始标题出发、4 个从剧情简介出发、4 个从英语网文市场习惯出发。随后系统在固定候选集上进行八维评分、程序复算、严重违规排除和确定性排名,输出候选集、排名 JSON 与可读的 Markdown 报告。
评分不是让模型“凭感觉”选一个
标题候选会接受八个维度的评估:
| 维度 | 关注点 |
|---|---|
| 语义忠实度 | 是否符合标题与故事前提。 |
| 英文自然度 | 是否像自然的英文标题。 |
| 类型与市场匹配 | 是否呈现正确的类型气质,并符合目标市场习惯。 |
| 读者吸引力与辨识度 | 是否清晰、易记且有吸引力。 |
| 简洁度与完整性安全 | 是否避免剧透、误导和凭空添加事实。 |
严重的语义不符、实体错误、类型错配或虚构卖点会让候选失去胜出资格。模型负责给出可审计的分项判断,但最终加权分数由程序以确定性算术独立复算;当模型计算与程序结果不一致时,差异也会保留在实验制品中。
正在建立的研究边界
这个项目把“评估优先”放在“调更强模型”之前:先定义冻结评估集和评分准则,再尝试优化排序器。数据、候选、标签、排名和评估结果都有稳定 ID 与版本,私有原始数据、处理语料、模型文件和人工标签则始终保留在本地。
这带来了一些刻意的边界:首版不做全文翻译、在线 CTR 优化、广泛爬取、多语言扩展、用户账号或异步任务系统。它目前是一个面向可信本地或受保护环境的同步服务,而不是完整的平台产品。
当前开发轨迹
| 时间 | 推进内容 |
|---|---|
| 7 月 27 日 | 初始化项目,先建立评估优先的研究契约与仓库脚手架。 |
| 7 月 31 日 | 完成两阶段标题选优基线:12 个候选生成与八维评分排名。 |
| 8 月 3 日 | 重构为分层架构,补齐 FastAPI 接口与 Docker 部署能力。 |
现在仓库已包含离线可复现的确定性适配器、公开合成样例、命令行工具、数据契约与测试;使用 OpenAI-compatible 适配器时,也可通过受控配置接入外部模型。项目仍在持续开发中,当前的核心目标是把“能运行的基线”推进为“可比较、可验证的研究结果”。
接下来的实验
后续迭代将沿着四个阶段推进:
- V0:规则基线 —— 固化可复现的 Top 3 结果与失败案例。
- V1:LLM 评审 —— 盲测点对点、成对比较与列表式评审的稳定性。
- V2:学习排序器 —— 在未触碰的冻结集上比较其与两类基线的提升,并报告不确定性。
- V3:有限人工反馈 —— 验证人工偏好能在哪些标题情境中修正弱标签偏差。
我希望这个 Lab 最终回答的不只是“哪个标题分数最高”,而是:在不同的故事类型、候选生成策略与评审方法下,什么样的标题本地化决策才真正可靠。
项目正在持续迭代中。欢迎查看 WebNovel Title Localization Lab 源码,也欢迎围绕评估协议、排序方法和错误案例提出建议。