LegoNN:构建模块化编码器-解码器模型
计算与语言
2023-07-12 v2 声音
音频与语音处理
摘要
最先进的编码器-解码器模型(例如用于机器翻译(MT)或自动语音识别(ASR))是作为原子单元端到端构建和训练的。模型的任何组件都不能在没有其他组件的情况下(重新)使用,使得跨任务共享部分(例如高资源解码器)变得不可能。我们描述了LegoNN,一种以使其部件可应用于其他任务而无需任何微调的方式构建编码器-解码器架构的方法。为实现这种可重用性,编码器与解码器模块之间的接口被锚定到预定义离散词汇表上的一系列边际分布。我们提出了两种摄取这些边际的方法;一种是可微分的,允许梯度在整个网络中流动,另一种是梯度隔离的。为使解码器模块能够在不同源语言的MT任务及其他如ASR的任务间移植,我们引入了模态不可知编码器,其由长度控制机制组成,以动态适配编码器的输出长度,从而匹配预训练解码器的期望输入长度范围。我们提出了若干实验来证明LegoNN模型的有效性:来自德英(De-En)MT任务的训练好的语言生成LegoNN解码器模块可在无任何微调的情况下重用于Europarl英语ASR和罗马尼亚语-英语(Ro-En)MT任务,达到或超越基线性能。经过微调后,LegoNN模型在Ro-En MT任务上提升1.5个BLEU点,并在Europarl ASR任务上实现12.5%的相对WER降低。为展示该方法的泛化能力,我们由一个解码器模块和三个模块组合了一个LegoNN ASR模型——每个模块均在不同的端到端训练模型及三个不同数据集中学习——实现了19.5%的整体WER降低。
引用
@article{arxiv.2206.03318,
title = {LegoNN: Building Modular Encoder-Decoder Models},
author = {Siddharth Dalmia and Dmytro Okhonko and Mike Lewis and Sergey Edunov and Shinji Watanabe and Florian Metze and Luke Zettlemoyer and Abdelrahman Mohamed},
journal= {arXiv preprint arXiv:2206.03318},
year = {2023}
}
备注
IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)