IOT:面向 Transformer 结构的实例级层重排序
计算与语言
2021-03-08 v1 人工智能
摘要
通过顺序堆叠的自注意力、(可选的)编码器-解码器注意力以及前馈层,Transformer 在自然语言处理(NLP)中取得了巨大成功,并衍生出许多变体。目前,几乎所有这些模型都假设层顺序是固定的,并且在所有数据样本间保持一致。我们观察到,不同的数据样本实际上偏好不同的层顺序。基于这一观察,在本工作中,我们打破了 Transformer 中固定层顺序的假设,并将实例级层重排序引入模型结构。我们的实例级有序 Transformer (IOT) 可通过重排序的层对变体函数进行建模,从而在参数数量几乎相同的约束下,使每个样本选择更优的层顺序以提升模型性能。为此,我们引入了一个参数与推理开销均可忽略的轻量预测器,为任意输入序列决定最具能力且最合适的层顺序。在 3 项任务(神经机器翻译、摘要生成与代码生成)和 9 个数据集上的实验证明了我们方法的一致改进。我们进一步表明,我们的方法也可应用于 Transformer 之外的其他架构。我们的代码发布于 Github。
引用
@article{arxiv.2103.03457,
title = {IOT: Instance-wise Layer Reordering for Transformer Structures},
author = {Jinhua Zhu and Lijun Wu and Yingce Xia and Shufang Xie and Tao Qin and Wengang Zhou and Houqiang Li and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2103.03457},
year = {2021}
}
备注
Accepted at ICLR-2021