中文

构建大规模英罗文学翻译资源:基于开放模型的框架

计算与语言 2026-01-21 v3 人工智能 机器学习

摘要

文学翻译最近在机器翻译研究中获得了作为一种独特且复杂任务的关注。然而,小型开放模型的翻译仍是一个开放问题。我们通过引入 TINYFABULIST TRANSLATION FRAMEWORK (TF2),一个用于英罗文学翻译数据集创建、微调和评估的统一框架来推动这一持续的研究工作,中心是创建和公开释放两种资源:一个紧凑且经过微调的语言模型 (TF2-12B) 和大规模合成平行数据集 (DS-TF2-EN-RO-3M 和 DS-TF2-EN-RO-15K)。在 TF1 (即 DS-TF1-EN-3M) 的基础上,我们解决了为低资源语言(如罗马尼亚语)提供丰富、高质量文学数据集的需求。我们的管道首先使用高性能大语言模型从 TF1 资源池中生成 15000 份高质量罗马尼亚语参考译文。随后,我们对 120 亿参数的开放权重模型进行两阶段微调:(i)指令微调以捕捉特定体裁的叙事风格,(ii)适配器压缩以实现高效部署。评估结合了 corpus 级别的 BLEU 和五维度基于大语言模型的评估标准(准确性、流畅性、连贯性、风格、文化适应性),提供对翻译质量的细致评估。结果表明,我们的微调模型在流畅性和 adequacy 上取得了强劲的表现,缩小了与顶尖专有模型在自动化和人类锚定评估下的差距,同时该模型开放、可访问且显著更具成本效益。除了微调模型和数据集,我们公开了所有脚本和评估提示。TF2 提供了一个端到端、可复现的管道,用于成本有效的翻译、跨语言叙事生成以及面向文化重要文学内容在低资源环境中广泛采用开放模型。

关键词

引用

@article{arxiv.2509.07829,
  title  = {Building Large-Scale English-Romanian Literary Translation Resources with Open Models},
  author = {Mihai Nadas and Laura Diosan and Andreea Tomescu and Andrei Piscoran},
  journal= {arXiv preprint arXiv:2509.07829},
  year   = {2026}
}

备注

25 pages, 8 figures, includes datasets and models released on Hugging Face