中文

超越语言边界:利用 LLM 进行低资源语言翻译

计算与语言 2024-11-19 v1 人工智能

摘要

大型语言模型(LLM)在广泛的任务和领域中取得了显著成功。然而,它们在低资源语言翻译中的表现,尤其是在翻译成这些语言时,仍未得到充分探索。这一差距带来了重大挑战,因为语言障碍阻碍了少数群体的文化保护和发展。为了解决这个问题,本文引入了一种新颖的基于检索的方法,通过关注关键术语来提高低资源语言的翻译质量,该方法涉及翻译关键词并从现有数据中检索相应示例。为了评估该方法的有效性,我们进行了从英语翻译成三种低资源语言的实验:切罗基语,一种北美极度濒危的土著语言;藏语,一种在亚洲具有重要历史和文化意义的语言;以及满语,一种现存使用者极少的语言。我们与 GPT-4o 和 LLaMA 3.1 405B 的零样本性能进行了比较,突显了这些模型在翻译成低资源语言时面临的重大挑战。相比之下,我们基于检索的方法通过更有效地利用现有资源,在提高词级准确性和整体语义理解方面显示出潜力。

关键词

引用

@article{arxiv.2411.11295,
  title  = {Transcending Language Boundaries: Harnessing LLMs for Low-Resource Language Translation},
  author = {Peng Shu and Junhao Chen and Zhengliang Liu and Hui Wang and Zihao Wu and Tianyang Zhong and Yiwei Li and Huaqin Zhao and Hanqi Jiang and Yi Pan and Yifan Zhou and Constance Owl and Xiaoming Zhai and Ninghao Liu and Claudio Saunt and Tianming Liu},
  journal= {arXiv preprint arXiv:2411.11295},
  year   = {2024}
}