中文

TopXGen:面向低资源机器翻译的主题多样化平行数据生成

计算与语言 2025-08-13 v1

摘要

大型语言模型(LLM)已被证明在机器翻译(MT)中通过使用上下文学习(ICL)表现良好,在翻译为高资源语言(HRL)时可与监督模型相媲美。然而,在翻译为低资源语言(LRL)时,它们仍然落后。通过相似性搜索进行示例选择和监督微调有所帮助,但它们带来的改进受到现有平行数据集规模、质量和多样性的限制。低资源机器翻译中的一种常用技术是合成平行数据创建,其中最常用的是反向翻译,即自动将现有的目标端文本翻译为源语言。然而,这假设存在高质量且相关的目标端文本,而这对许多低资源语言来说并不容易获得。在本文中,我们提出了TopXGen,这是一种基于大型语言模型的方法,用于在多种低资源语言中生成高质量且主题多样化的数据,然后可以对这些数据进行反向翻译,为上下文学习和微调生成有用且多样化的平行文本。我们的直觉是,虽然大型语言模型在翻译为低资源语言时表现挣扎,但它们能很好地翻译为高资源语言的能力及其多语言性,使其能够生成高质量、听起来自然的目标端文本,这些文本可以很好地翻译为高资源的源语言。我们展示了TopXGen在微调和上下文学习过程中提升了大型语言模型的翻译性能。代码和输出可在https://github.com/ArmelRandy/topxgen获取。

关键词

引用

@article{arxiv.2508.08680,
  title  = {TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation},
  author = {Armel Zebaze and Benoît Sagot and Rachel Bawden},
  journal= {arXiv preprint arXiv:2508.08680},
  year   = {2025}
}