面向视觉语音识别上界估计:视觉唇读可行性数据库
计算机视觉与模式识别
2017-04-27 v1
摘要
语言是人类最常用的交流方式,涉及听觉和视觉通道的感知。自动语音识别专注于解读音频信号,尽管视频可提供与音频互补的信息。然而,利用视觉信息被证明颇具挑战。一方面,研究者指出音素与视素(视觉单元)之间的映射是一对多的,因为存在视觉上相似且难以区分的音素。另一方面,已知有些人擅长唇读(如聋人)。我们在受控条件下研究纯视觉语音识别的极限。为此,我们设计了一个新数据库,其中说话者知晓被唇读并旨在便于唇读。文献中对听力受损者是否比正常听力者更擅长唇读存在分歧。随后,我们分析 9 名听力受损者和 15 名正常听力者的唇读能力差异。最后,将人类能力与视觉自动语音识别系统的性能进行比较。测试中,听力受损参与者表现优于正常听力参与者,但未达统计显著性。人类观察者能解码 44% 的语音内容。相比之下,纯视觉自动系统仅达到 20% 的词识别率。然而,若以音素为单位比较,两者获得的识别率非常相似,均略高于 50%。这表明人类唇读与自动语音读取的差距可能更多与语境利用有关,而非解读口部外观的能力。
引用
@article{arxiv.1704.08028,
title = {Towards Estimating the Upper Bound of Visual-Speech Recognition: The Visual Lip-Reading Feasibility Database},
author = {Adriana Fernandez-Lopez and Oriol Martinez and Federico M. Sukno},
journal= {arXiv preprint arXiv:1704.08028},
year = {2017}
}
备注
IEEE International Conference on Automatic Face and Gesture Recognition