中文

基于分层金字塔卷积与自注意力的唇读方法

计算机视觉与模式识别 2020-12-29 v1 图像与视频处理

摘要

本文提出一种新颖的深度学习架构以改善词级唇读。一方面,我们首次将多尺度处理引入唇读的空间特征提取中。具体地,我们提出分层金字塔卷积(HPConv)以替换原始模块中的标准卷积,从而提升模型发现细粒度唇部运动的能力。另一方面,我们利用自注意力融合序列所有时间步的信息,使模型更关注相关帧。这两种优势相结合以进一步增强模型的分类能力。在 Lip Reading in the Wild (LRW) 数据集上的实验表明,我们提出的模型达到了 86.83% 的准确率,比当前最优方法绝对提升 1.53%。我们还进行了大量实验以更好地理解所提模型的行为。

关键词

引用

@article{arxiv.2012.14360,
  title  = {Lip-reading with Hierarchical Pyramidal Convolution and Self-Attention},
  author = {Hang Chen and Jun Du and Yu Hu and Li-Rong Dai and Chin-Hui Lee and Bao-Cai Yin},
  journal= {arXiv preprint arXiv:2012.14360},
  year   = {2020}
}

备注

5 pages, 7 figures