仅基于平行数据训练的大型语言模型的翻译能力研究
计算与语言
2024-06-14 v1
摘要
近年来,大型语言模型(LLM)在包括机器翻译在内的广泛自然语言处理(NLP)任务中展现了卓越的能力。然而,先前的方法主要依赖于指令微调或持续预训练等迭代过程,而仅基于平行数据训练LLM所面临的挑战尚未得到充分探索。在本工作中,我们提出了PLUME(Parallel Language Model),这是一个包含三个具有不同词汇量大小(32k、128k和256k)的2B LLM的集合,这些模型仅在以加泰罗尼亚语为中心的平行例子上进行训练。这些模型在16个有监督翻译方向和56个零样本翻译方向上的表现与先前的编码器-解码器架构相当。利用这组模型,我们对LLM的翻译能力进行了深入研究,探究了它们的性能、提示中不同元素的影响以及它们的跨语言表示空间。
引用
@article{arxiv.2406.09140,
title = {Investigating the translation capabilities of Large Language Models trained on parallel data only},
author = {Javier García Gilabert and Carlos Escolano and Aleix Sant Savall and Francesca De Luca Fornaciari and Audrey Mash and Xixian Liao and Maite Melero},
journal= {arXiv preprint arXiv:2406.09140},
year = {2024}
}
备注
We release our code at: https://github.com/projecte-aina/Plume