中文

语言对所有人来说都非常稀有

计算与语言 2024-12-19 v1 机器学习

摘要

在克服语言障碍的探索中,像NLLB这样的编码器-解码器模型已将机器翻译扩展到稀有语言,有些模型(例如NLLB 1.3B)甚至可以在单个GPU上进行训练。虽然通用大语言模型在翻译方面表现良好,但开源大语言模型在针对涉及未知语料的特定任务进行微调时显示出极强的竞争力。我们引入了LYRA(Language verY Rare for All),一种结合了开源大语言模型微调、检索增强生成(RAG)和来自相关高资源语言的迁移学习的新方法。本研究完全专注于单GPU训练以促进易用性。我们的研究聚焦于法语和摩纳哥语(一种因语料库有限而现有翻译工具不支持的稀有语言)之间的双向翻译。我们的结果证明了LYRA的有效性,在稀有语言翻译中经常超越并持续匹配最先进的编码器-解码器模型。

关键词

引用

@article{arxiv.2412.13924,
  title  = {Language verY Rare for All},
  author = {Ibrahim Merad and Amos Wolf and Ziad Mazzawi and Yannick Léo},
  journal= {arXiv preprint arXiv:2412.13924},
  year   = {2024}
}