通过翻译混合指令增强大语言模型的文档级翻译
计算与语言
2024-01-17 v1
摘要
现有的用于机器翻译的大语言模型 (LLMs) 通常在句子级翻译指令上进行微调,并在句子级取得令人满意的性能。然而,当应用于文档级翻译时,这些模型面临重大挑战,特别是在处理包含超过 512 个 token 的文档时。这一挑战源于句子级覆盖问题,即文档中的后续句子未被翻译。因此,在句子级翻译指令上微调的 LLMs 的文档级翻译能力受到显著限制。我们推测,LLMs 文档级翻译性能薄弱的主要原因是缺乏文档到文档的映射能力。为解决此问题,我们提出了一种结合不同长度的句子级和文档级翻译指令来微调 LLMs 的方法。我们提出的翻译混合指令使 LLMs(Llama-2~7B 和 13B)能够保持一致的翻译性能,范围从句子级到包含多达 2048 个 token 的文档。大量实验结果表明,所提出的方法显著增强了 LLMs 在 10 个语言对上的文档级翻译能力,有效缓解了文档级翻译中的句子级覆盖问题。对话语现象的实验表明,我们的文档级翻译方法在 BLEU 分数和话语连贯性方面均显著提高了翻译质量。
引用
@article{arxiv.2401.08088,
title = {Enhancing Document-level Translation of Large Language Model via Translation Mixed-instructions},
author = {Yachao Li and Junhui Li and Jing Jiang and Min Zhang},
journal= {arXiv preprint arXiv:2401.08088},
year = {2024}
}
备注
under review