解码视位:改进机器唇读
计算机视觉与模式识别
2018-05-09 v1 音频与语音处理
摘要
机器唇读是从视觉线索进行语音识别,是语音处理与计算机视觉领域的一个小众研究问题。当前挑战分为两类:视频内容,如语速;或视频录制参数,如视频分辨率。我们表明,计算机成功唇读并不需要高清视频。术语“视位”在机器唇读中用于表示一个视觉线索或手势,它对应于一个音位子群,其中音位在视觉上不可区分。音位是人能发出的最小声音,由于每个视位对应多个音位,单元间的映射呈现多对一关系。已有多种映射被提出,我们比较了这些映射,结果表明 Lee 的映射最佳。我们提出了一种新的说话人相关音位-视位映射方法,并将其与 Lee 的映射进行比较。我们的结果显示了音位聚类的敏感性,并利用新知识增强了一个传统机器唇读系统。在机器唇读中已观察到,分类器需要对测试对象进行训练才能达到准确率。因此,机器唇读高度依赖于说话人。相反,说话人独立性是指对非训练说话人的鲁棒分类。我们研究了说话人之间音位-视位映射的依赖性,并表明视位本身变异性不高,但具有相同真值的个体说话人视位间轨迹存在高变异性。这意味着依赖于每个个体集合内视位的数量。我们表明,先前的音位-视位映射很少包含足够的视位,而最优数量因说话人而异,范围在 11-35 之间。最后,我们从视位解码回音位并组成单词。我们的新方法在音位分类器的分层训练中使用最优范围的视位,并展示了分类准确率的显著提升。
引用
@article{arxiv.1710.01288,
title = {Decoding visemes: improving machine lipreading},
author = {Helen L Bear},
journal= {arXiv preprint arXiv:1710.01288},
year = {2018}
}
备注
PhD thesis. Computer Vision and Pattern Recognition (CVPR), Women in Computer Vision (WiCV) Workshop 2017