中文

Deja-vu:深度 Transformer 网络中的双重特征呈现与迭代损失

计算与语言 2020-02-14 v2 机器学习 声音 音频与语音处理

摘要

深度声学模型通常在网络第一层接收特征,并在后续层处理日益抽象的表示。此处,我们提议在声学模型的多个深度处馈入输入特征。由于我们的动机是使声学模型能依据部分假设重新审视其输入特征,我们引入了中间模型头与损失函数。我们在深度 Transformer 网络背景下研究该架构,并对前一层激活与输入特征使用注意力机制。为训练该模型的中间输出假设,我们在每次特征重用前的每一层施加目标函数。我们发现,仅使用此种迭代损失即显著改善性能,并同时赋能输入特征重用。我们在 Librispeech 与大规模视频数据集上给出结果,相对改善在 Librispeech 上为 10–20%,在视频上为 3.2–13%。

关键词

引用

@article{arxiv.1910.10324,
  title  = {Deja-vu: Double Feature Presentation and Iterated Loss in Deep Transformer Networks},
  author = {Andros Tjandra and Chunxi Liu and Frank Zhang and Xiaohui Zhang and Yongqiang Wang and Gabriel Synnaeve and Satoshi Nakamura and Geoffrey Zweig},
  journal= {arXiv preprint arXiv:1910.10324},
  year   = {2020}
}

备注

Accepted in IEEE ICASSP 2020