质量还是数量?关于大语言模型低资源翻译中的数据规模与多样性
计算与语言
2024-10-07 v2
摘要
尽管大语言模型(LLM)在机器翻译(MT)中备受关注,但其在低资源语言(LRLs)中的性能仍显著落后于神经机器翻译(NMT)模型。在本工作中,我们探讨了使LLM适用于低资源场景所需的条件。特别地,我们重新审视了两个因素:a)平行数据的重要性与应用;b)监督式微调(Supervised Fine-Tuning, SFT)中的数据多样性。最近,平行数据在为LLM适配MT方面使用率有所下降,数据多样性则被采纳以促进跨语言和跨任务的迁移。然而,对于低资源LLM-MT,我们发现两者的实际情况恰恰相反:a)平行数据在预训练和SFT中至关重要;b)数据多样性往往会导致干扰而非迁移。我们针对三个LLM在两个低资源语言群——土著美洲语言和北东印度语言——进行了实验,结果呈现出一致趋势,凸显了我们发现的普遍适用性。我们相信,这些见解对扩展到能够有效服务LRLs的大规模多语言LLM-MT模型将大有裨益。
引用
@article{arxiv.2408.12780,
title = {Quality or Quantity? On Data Scale and Diversity in Adapting Large Language Models for Low-Resource Translation},
author = {Vivek Iyer and Bhavitvya Malik and Pavel Stepachev and Pinzhen Chen and Barry Haddow and Alexandra Birch},
journal= {arXiv preprint arXiv:2408.12780},
year = {2024}
}
备注
10 pages, 6 figures