基于度量学习缩小视觉语音识别中正常与无声语音间的差距
音频与语音处理
2023-10-17 v2 机器学习
摘要
本文提出一种新颖的度量学习方法,以解决视觉语音识别(VSR)中正常语音与无声语音之间的性能差距。两者唇部运动的差异对现有VSR模型构成挑战,这些模型在应用于无声语音时准确率下降。为解决此问题并应对无声语音训练数据的稀缺,我们提议利用正常与无声语音间共享的字面内容,提出一种基于视位的度量学习方法。具体而言,若两类语音具有相似的视位表示,我们旨在将它们的输入映射至潜空间中彼此接近。通过最小化两类语音之间及各自内部预测视位概率分布的Kullback-Leibler散度,我们的模型有效学习并预测视位身份。我们的评估表明,即便训练数据有限,该方法也提升了无声VSR的准确率。
引用
@article{arxiv.2305.14203,
title = {Improving the Gap in Visual Speech Recognition Between Normal and Silent Speech Based on Metric Learning},
author = {Sara Kashiwagi and Keitaro Tanaka and Qi Feng and Shigeo Morishima},
journal= {arXiv preprint arXiv:2305.14203},
year = {2023}
}
备注
Accepted by INTERSPEECH 2023