比较异质视觉手势以度量视觉语音信号的多样性
图像与视频处理
2018-05-09 v1 计算机视觉与模式识别
声音
音频与语音处理
摘要
唇读时观察到的视觉唇部手势有几种工作定义,最常见的两种是:“音素的视觉等价物”和“在嘴唇上无法区分的音素”。迄今为止尚无形式化定义,部分原因是迄今为止我们尚未建立视素(viseme)与音素之间的双向关系或映射。一些证据表明视觉语音高度依赖于说话者。因此,此处我们使用音素聚类方法为单个及多个说话者构建新的音素到视素映射。我们测试这些音素到视素映射以考察说话者视觉说话的相似程度,并使用符号秩检验来度量个体间的距离。我们得出结论:广义而言,说话者具有相同的口部手势库,其差异在于手势的使用方式。
引用
@article{arxiv.1805.02948,
title = {Comparing heterogeneous visual gestures for measuring the diversity of visual speech signals},
author = {Helen L Bear and Richard Harvey},
journal= {arXiv preprint arXiv:1805.02948},
year = {2018}
}