检验语言模型架构在机器翻译中的缩放与迁移性质
计算与语言
2022-02-17 v3 机器学习
摘要
自然语言理解与生成模型遵循两种主导架构范式之一:在单一层栈中处理拼接序列的语言模型(LMs),以及为输入与输出处理使用独立层栈的编码器-解码器模型(EncDec)。在机器翻译中,EncDec 长期为首选方法,但鲜有研究考察 LMs 的性能。本工作中,我们在数据与模型规模系统性变化下,彻底考察若干架构设计选择对 LMs 在双语、(大规模)多语与零样本翻译任务上性能的作用。结果显示:(i) 不同 LMs 具有不同的缩放性质,架构差异常在较小规模时对模型性能有显著影响,但随参数量增加性能差距收窄;(ii) 若干设计选择,包括因果掩码与对源序列的语言建模目标,对翻译质量有损害效应;(iii) 当源序列配以前全可见掩码时,LMs 在监督双语与多语翻译任务上可与 EncDec 持平,并通过减少离目标翻译而大幅改善零样本方向。
引用
@article{arxiv.2202.00528,
title = {Examining Scaling and Transfer of Language Model Architectures for Machine Translation},
author = {Biao Zhang and Behrooz Ghorbani and Ankur Bapna and Yong Cheng and Xavier Garcia and Jonathan Shen and Orhan Firat},
journal= {arXiv preprint arXiv:2202.00528},
year = {2022}
}