中文

用于鲁棒视觉语音识别的3D特征金字塔注意力模块

计算机视觉与模式识别 2019-01-14 v4

摘要

视觉语音识别是基于视觉信息(尤其是嘴唇运动)从视频中解码语音内容的任务,亦被称为唇读。受唇读中存在的两个问题的启发——即发音相似的词以及词时长的变化——我们提出了一种新颖的3D特征金字塔注意力(3D-FPA)模块,以联合提升特征在空间域和时间域上的表征能力。具体而言,输入特征在空间和 temporal 维度上均下采样3次以构建时空特征金字塔。随后高层特征被上采样并与低层特征结合,最终生成逐像素软注意力掩码与输入特征相乘。它增强了特征的判别力并在解码视觉语音时利用了时间多尺度信息。此外,该模块为视频分析任务中构建和利用时间金字塔结构提供了新方法。与图像分析任务中丰富的空间特征金字塔工作相比,时间特征金字塔领域仍在探索中。为验证我们所提模块的有效性和适应性,我们将该模块嵌入句子级唇读模型LipNet中,实现了词错误率绝对下降3.6%,以及嵌入词级模型中,实现了准确率绝对提升1.4%。

关键词

引用

@article{arxiv.1810.06178,
  title  = {3D Feature Pyramid Attention Module for Robust Visual Speech Recognition},
  author = {Jingyun Xiao},
  journal= {arXiv preprint arXiv:1810.06178},
  year   = {2019}
}

备注

9 pages