西班牙语连续唇读中视觉特征的分析
计算机视觉与模式识别
2023-11-22 v1 计算与语言
摘要
在对话过程中,我们的大脑负责整合从多种感官获得的信息,以提升理解所感知信息的能力。不同研究已表明在此类情境中呈现视觉信息的重要性。然而,唇读是一项复杂任务,其目标是在无音频时解读语音。由于舍弃了听觉这一关键感官,有必要认识到此种缺失所带来的挑战。本文对不同语音视觉特征进行分析,旨在识别其中何种方法最适合捕捉自然西班牙语唇部运动的本质,从而应对自动视觉语音识别任务。为评估我们的系统,我们呈现一个从RTVE数据库子集编译的视听语料库,该库曾用于Albayzín评测。我们采用基于隐马尔可夫模型与高斯混合模型的传统系统。结果表明,尽管任务困难,在受限条件下我们获得的识别结果确定:将特征唇(eigenlips)与深度特征结合使用是最佳视觉方法。
引用
@article{arxiv.2311.12468,
title = {Analysis of Visual Features for Continuous Lipreading in Spanish},
author = {David Gimeno-Gómez and Carlos-D. Martínez-Hinarejos},
journal= {arXiv preprint arXiv:2311.12468},
year = {2023}
}
备注
Accepted in Proceedings of IberSpeech 2020 ( https://www.isca-speech.org/archive/iberspeech_2021/gimenogomez21_iberspeech.html )