Deja-vu:深度 Transformer 网络中的双重特征呈现与迭代损失
计算与语言
2020-02-14 v2 机器学习
声音
音频与语音处理
摘要
深度声学模型通常在网络第一层接收特征,并在后续层处理日益抽象的表示。此处,我们提议在声学模型的多个深度处馈入输入特征。由于我们的动机是使声学模型能依据部分假设重新审视其输入特征,我们引入了中间模型头与损失函数。我们在深度 Transformer 网络背景下研究该架构,并对前一层激活与输入特征使用注意力机制。为训练该模型的中间输出假设,我们在每次特征重用前的每一层施加目标函数。我们发现,仅使用此种迭代损失即显著改善性能,并同时赋能输入特征重用。我们在 Librispeech 与大规模视频数据集上给出结果,相对改善在 Librispeech 上为 10–20%,在视频上为 3.2–13%。
关键词
引用
@article{arxiv.1910.10324,
title = {Deja-vu: Double Feature Presentation and Iterated Loss in Deep Transformer Networks},
author = {Andros Tjandra and Chunxi Liu and Frank Zhang and Xiaohui Zhang and Yongqiang Wang and Gabriel Synnaeve and Satoshi Nakamura and Geoffrey Zweig},
journal= {arXiv preprint arXiv:1910.10324},
year = {2020}
}
备注
Accepted in IEEE ICASSP 2020