多语言预训练目标:语言建模与翻译的比较
计算与语言
2024-10-08 v2
摘要
预训练语言模型(Pretrained Language Models, PLMs)展现出惊人的性能,并已引起NLP社区的注意。因此,确立预训练的最佳实践已成为NLP研究的主要焦点,尤其是由于从单语英语模型所获得的见解可能并不一定适用于更复杂的多语言模型。当前最先进技术的一个重要局限是:不同作品很少进行可比性分析:它们常常讨论不同的参数数量、训练数据和评估方法。本文在受控的方法学环境下提出了多语言预训练目标的比较。我们确保训练数据和模型架构具有可比性,并讨论在探测和微调情景中所观察到的六种语言的下游性能。我们提出了两个关键观察:(1)架构决定了哪种预训练目标是最优的;(2)在恰当的条件下,多语言翻译是一个非常有效的预训练目标。我们将代码、数据和模型权重均已在\texttt{\url{https://github.com/Helsinki-NLP/lm-vs-mt}}上提供。
引用
@article{arxiv.2407.15489,
title = {A Comparison of Language Modeling and Translation as Multilingual Pretraining Objectives},
author = {Zihao Li and Shaoxiong Ji and Timothee Mickus and Vincent Segonne and Jörg Tiedemann},
journal= {arXiv preprint arXiv:2407.15489},
year = {2024}
}
备注
Proceedings of EMNLP 2024