连续视觉语音中说话人间的视觉手势变异性
计算机视觉与模式识别
2018-04-26 v1 音频与语音处理
摘要
近期深度学习方法在机器唇读研究领域的应用,为我们提供了两种提升系统性能的途径。要么整体性地开发端到端系统,要么通过实验加深我们对视觉语音信号的理解。后一种途径更为困难,但这种知识将使研究人员既能改进系统,又能将新知识应用于诸如言语治疗等其他领域。唇读系统的一个挑战在于分类器的正确标注。这些标注映射了嘴唇上的视素与所发出音素之间的估计函数。在此我们探究这种映射是否依赖于说话人?先前的工作研究了基于说话人依赖(SD)视素的孤立词识别,我们将其扩展到连续语音。以 SD 结果和孤立词性能为基准,我们使用 RMAV 数据集中的说话人进行测试,观察到在连续语音中,视素间的轨迹对说话人区分具有更大的负面影响。
引用
@article{arxiv.1710.01297,
title = {Visual gesture variability between talkers in continuous visual speech},
author = {Helen L Bear},
journal= {arXiv preprint arXiv:1710.01297},
year = {2018}
}