中文

仅视觉识别正常、耳语与无声语音

计算机视觉与模式识别 2018-02-20 v1

摘要

无声语音接口近来被提出作为在声学信号不可用时实现交流的一种方式。这带来了为无声和耳语语音构建视觉语音识别系统的需求。然而,几乎所有近期提出的系统都仅在发声数据上训练。这与文献中表明唇部运动依语音模式而变化的证据相矛盾。在本工作中,我们引入一个公开可用的新的音视频数据库,其中包含正常、耳语和无声语音。据我们所知,这是首个仅使用视觉模态研究三种语音模式差异的研究。我们展示当分别在正常与耳语上训练和测试(反之亦然)时,分类率出现高达3.7%的绝对下降。当模型在无声语音上测试时,报告了高达8.5%的更高下降。这揭示了三种语音模式间确实存在视觉差异,且用发声训练数据直接训练无声语音识别系统的常见假设可能并不成立。

关键词

引用

@article{arxiv.1802.06399,
  title  = {Visual-Only Recognition of Normal, Whispered and Silent Speech},
  author = {Stavros Petridis and Jie Shen and Doruk Cetin and Maja Pantic},
  journal= {arXiv preprint arXiv:1802.06399},
  year   = {2018}
}

备注

Accepted to ICASSP 2018