中文

跨语言监督改进大语言模型预训练

计算与语言 2023-05-22 v1 机器学习

摘要

近期大语言模型(LLM)预训练的迅速进展依赖于使用自监督语言建模目标,如下一个词元预测或跨度破坏。另一方面,机器翻译系统大多使用需要源语言与目标语言之间对齐数据的跨语言监督进行训练。我们证明,在自监督语言建模目标与有监督机器翻译目标混合的数据上预训练大语言模型,从而在预训练期间纳入跨语言平行数据,可得到具有更好上下文学习能力的模型。由于预训练是资源极其密集的过程,且对两目标间最佳混合比进行网格搜索成本高昂,我们提出一种简单而有效的策略,在预训练期间学习该混合比。

关键词

引用

@article{arxiv.2305.11778,
  title  = {Cross-Lingual Supervision improves Large Language Models Pre-training},
  author = {Andrea Schioppa and Xavier Garcia and Orhan Firat},
  journal= {arXiv preprint arXiv:2305.11778},
  year   = {2023}
}