以参数绑定多Transformer平衡成本与收益
计算与语言
2020-02-21 v1 机器学习
摘要
我们提出并评估了一种训练多个参数绑定的Transformer的新方法,该方法将多个模型压缩为一个,从而在解码时动态选择编码器和解码器层的数量。在序列到序列建模中,通常将N层编码器的最后一层输出送入M层解码器,并使用最后一层解码器的输出计算损失。相反,我们的方法计算由N×M个损失组成的单一损失,其中每个损失由连接到N个编码器层之一的M个解码器层之一的输出计算而来。这样的模型包含了具有不同编码器和解码器层数的N×M个模型,并可用于以少于最大编码器和解码器层数的层数进行解码。我们随后提出了一种先验选择编码器和解码器层数以加速解码的机制,并探索了层的循环堆叠与知识蒸馏用于模型压缩。我们给出了将所提方法应用于神经机器翻译的成本收益分析,表明它们能在保持翻译质量的同时降低解码成本。
引用
@article{arxiv.2002.08614,
title = {Balancing Cost and Benefit with Tied-Multi Transformers},
author = {Raj Dabre and Raphael Rubino and Atsushi Fujita},
journal= {arXiv preprint arXiv:2002.08614},
year = {2020}
}
备注
Extended version of our previous manuscript available at arXiv:1908.10118