中文

面向章节级上下文感知文学翻译的大语言模型研究

计算与语言 2024-07-15 v1 机器学习

摘要

现有文档级翻译数据集中的篇章现象较为稀疏,这是开发基于上下文的机器翻译模型的根本性障碍。此外,大多数现有文档级语料库和基于上下文的机器翻译方法都依赖于不切实际的句子级对齐假设。为缓解这些问题,我们首先构建了一个由 160 本具有复杂篇章结构的中文-英文文学作品组成的新型数据集。然后,我们提出了一种更为务实且具有挑战性的上下文感知翻译设定,称为章节到章节(chapter-to-chapter,Ch2Ch)翻译,并探讨了常用机器翻译模型在该设定下的表现。进一步,我们引入了一种在 Ch2Ch 文学翻译领域微调大语言模型(LLM)的方法,显著优于基线模型。在我们的全面分析中,我们揭示了在 Ch2Ch 设定下进行文学翻译本质上具有挑战性,这涉及模型学习方法和翻译解码算法。

关键词

引用

@article{arxiv.2407.08978,
  title  = {Towards Chapter-to-Chapter Context-Aware Literary Translation via Large Language Models},
  author = {Linghao Jin and Li An and Xuezhe Ma},
  journal= {arXiv preprint arXiv:2407.08978},
  year   = {2024}
}

备注

Preprint