利用视位以改善视觉语音表征与唇读
计算机视觉与模式识别
2023-07-20 v1
摘要
唇读是一项具有挑战性的任务,在语音识别、人机交互和安全系统中有诸多潜在应用。然而,现有唇读系统常因视频特征的局限而精度不高。本文提出一种新方法,利用视位(即语音上相似的唇形组)为唇读提取更具判别力且鲁棒的视频特征。我们在多项任务上评估该方法,包括词级与句级唇读,以及使用Arman-AV数据集(一个大规模波斯语语料库)的视听语音识别。实验结果表明,我们的基于视位的方法在所有这些任务上持续优于最先进的方法。所提方法将唇读词错率(WER)相对于最佳先前方法相对降低了9.1%。
引用
@article{arxiv.2307.10157,
title = {Leveraging Visemes for Better Visual Speech Representation and Lip Reading},
author = {Javad Peymanfard and Vahid Saeedi and Mohammad Reza Mohammadi and Hossein Zeinali and Nasser Mozayani},
journal= {arXiv preprint arXiv:2307.10157},
year = {2023}
}