中文

如何教 DNN 在语音识别中关注视觉模态

音频与语音处理 2020-04-20 v1 机器学习

摘要

视听语音识别(AVSR)旨在建模并由此利用人声与相应嘴部运动之间的动态关系。最近提出的一种基于最先进序列到序列神经网络的多模态融合策略 AV Align,尝试通过显式对齐语音的声学与视觉表示来建模该关系。本研究探究 AV Align 的内部机制并可视化视听对齐模式。我们的实验在两个最大的公开 AVSR 数据集 TCD-TIMIT 和 LRS2 上进行。我们发现 AV Align 在 TCD-TIMIT 上以总体单调的模式在帧级别学习对齐语音的声学与视觉表示。我们还确定了在更具挑战性的 LRS2 上最初未见到优于纯音频语音识别的原因。我们提出一种正则化方法,涉及从视觉表示预测与嘴唇相关的动作单元。我们的正则化方法更好地利用了视觉模态,根据噪声水平不同带来 7% 到 30% 的性能提升。此外,我们表明另一种 Watch, Listen, Attend, and Spell 网络也受与 AV Align 相同问题的影响,且我们提出的方法可有效帮助其学习视觉表示。我们的发现验证了该正则化方法对 AVSR 的适用性,并鼓励研究者在存在主导模态时重新思考多模态收敛问题。

关键词

引用

@article{arxiv.2004.08250,
  title  = {How to Teach DNNs to Pay Attention to the Visual Modality in Speech Recognition},
  author = {George Sterpu and Christian Saam and Naomi Harte},
  journal= {arXiv preprint arXiv:2004.08250},
  year   = {2020}
}

备注

in IEEE/ACM Transactions on Audio, Speech, and Language Processing (to appear)