面向唇读的多粒度时空建模
计算机视觉与模式识别
2019-09-04 v2 音频与语音处理
摘要
唇读旨在通过对说话者唇部运动的视觉分析,从视频中识别语音内容。由于存在同形唇音词(即涉及相同或高度相似唇部运动的词),以及不同说话者间多样的唇部外观与运动模式,这是一项具有挑战性的任务。为应对这些挑战,我们提出了一种新颖的唇读模型,通过对说话过程的多粒度时空建模,不仅捕捉词与词之间的细微差别,也捕捉不同说话者的风格。具体而言,我们首先通过视觉前端提取帧级细粒度特征与短时中粒度特征,然后将二者结合以获得具有相似音素的词的判别性表示。接下来,一个增强了时间注意力的双向 ConvLSTM 聚合整个输入序列中的时空信息,期望能够捕捉每个词的粗粒度模式,并对说话人身份、光照条件等各种条件具有鲁棒性。通过在统一框架中充分利用来自不同层级的信息,该模型不仅能区分发音相似的词,也对外观变化变得鲁棒。我们在两个具有挑战性的词级唇读基准上评估了我们的方法,展示了所提方法的有效性,这也证明了上述论断。
引用
@article{arxiv.1908.11618,
title = {Multi-Grained Spatio-temporal Modeling for Lip-reading},
author = {Chenhao Wang},
journal= {arXiv preprint arXiv:1908.11618},
year = {2019}
}