用于基于 Transformer 语音识别的弱注意力抑制
音频与语音处理
2020-05-20 v1 计算与语言
摘要
Transformer 最初为自然语言处理 (NLP) 任务提出,最近在自动语音识别 (ASR) 中取得了巨大成功。然而,相邻的声学单元(即帧)高度相关,且它们之间的长距离依赖较弱,不同于文本单元。这表明 ASR 可能受益于稀疏且局部的注意力。在本文中,我们提出弱注意力抑制 (WAS),一种动态诱导注意力概率稀疏性的方法。我们证明 WAS 相比强 Transformer 基线带来一致的词错误率 (WER) 提升。在广泛使用的 LibriSpeech 基准上,我们提出的方法为可流式 Transformer 在 test-clean 上降低 WER 10%、在 test-other 上降低 5%,从而在流式模型中达到新的 SOTA。进一步分析显示 WAS 学习抑制非关键和冗余的连续声学帧的注意力,且更可能抑制过去帧而非未来帧。这表明前瞻在基于注意力的 ASR 模型中的重要性。
引用
@article{arxiv.2005.09137,
title = {Weak-Attention Suppression For Transformer Based Speech Recognition},
author = {Yangyang Shi and Yongqiang Wang and Chunyang Wu and Christian Fuegen and Frank Zhang and Duc Le and Ching-Feng Yeh and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2005.09137},
year = {2020}
}
备注
submitted to interspeech 2020