多路径Transformer更优:以神经机器翻译为例的研究
计算与语言
2023-05-11 v1 人工智能
摘要
多年来,机器学习中的模型性能与模型规模服从幂律关系。出于参数效率的考虑,近期研究聚焦于增加模型深度而非宽度以获得更好性能。在本文中,我们通过参数高效的多路径结构研究模型宽度如何影响Transformer模型。为了更好地融合从不同路径提取的特征,我们在每个子层添加了三个额外操作:每条路径末尾的归一化、产生更多特征的廉价操作,以及灵活融合所有特征的可学习加权机制。在12个WMT机器翻译任务上的大量实验表明,在参数数量相同的情况下,较浅的多路径模型可以达到与较深模型相似甚至更好的性能。这表明我们应更多关注多路径结构,并且在训练更好的大规模Transformer时应在模型深度和宽度之间取得平衡。
引用
@article{arxiv.2305.05948,
title = {Multi-Path Transformer is Better: A Case Study on Neural Machine Translation},
author = {Ye Lin and Shuhan Zhou and Yanyang Li and Anxiang Ma and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2305.05948},
year = {2023}
}
备注
accepted by EMNLP2022 Findings