中文

面向有效唇读互信息最大化

计算机视觉与模式识别 2020-03-17 v1

摘要

近年来,由于深度学习的快速发展及其广泛潜在应用,唇读受到越来越多的研究关注。获得良好唇读性能的一个关键点很大程度上取决于表征在捕获唇部运动信息的同时抵抗由姿态、光照条件、说话人外观等变化所产生噪声的有效性。针对该目标,我们提出在局部特征层面与全局序列层面引入互信息约束,以增强特征与语音内容的关系。一方面,我们约束每个时间步生成的特征,通过施加局部互信息最大化约束(LMIM)使其与语音内容具有强关联,从而提升模型发现细粒度唇部运动及相似发音词(如“spend”与“spending”)间细粒度差异的能力。另一方面,我们在全局序列层面引入互信息最大化约束(GMIM),使模型能更多关注与语音内容相关的关键帧,而较少关注说话过程中出现的各类噪声。结合这两方面优势,所提方法有望在实现有效唇读时兼具判别性与鲁棒性。为验证该方法,我们在两个大规模基准上评估,并从多方面进行详细分析与比较,包括 LMIM 与 GMIM 同基线的比较、所学表征的可视化等。结果不仅证明了所提方法的有效性,还在两个基准上报告了新的 SOTA 性能。

关键词

引用

@article{arxiv.2003.06439,
  title  = {Mutual Information Maximization for Effective Lip Reading},
  author = {Xing Zhao and Shuang Yang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2003.06439},
  year   = {2020}
}

备注

8 pages, Accepted in the 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020)