不同数据条件下端到端连续西班牙语唇读的评估
计算机视觉与模式识别
2025-02-18 v2
摘要
视觉语音识别仍然是一个开放的研究问题,由于摒弃了听觉感官,必须考虑不同的挑战,例如视觉歧义、说话者之间的个体差异以及沉默的复杂建模。尽管如此,得益于大规模数据库的可用性和强大注意力机制的使用,该领域最近取得了显著的成果。此外,除英语之外的多种语言如今也成为关注的焦点。本文展示了西班牙语自动连续唇读的显著进展。首先,提出了一种基于混合 CTC/Attention 架构的端到端系统。在两个性质迥异的语料库上进行了实验,取得了最先进的结果,显著提高了迄今为止在两个数据库上获得的最佳性能。此外,还进行了彻底的消融研究,研究了构成架构的不同组件如何影响语音识别的质量。然后,进行了严格的错误分析,以探究可能影响自动系统学习的不同因素。最后,巩固了一个新的西班牙语唇读基准。代码和训练好的模型可在 https://github.com/david-gimeno/evaluating-end2end-spanish-lipreading 获取。
引用
@article{arxiv.2502.00464,
title = {Evaluation of End-to-End Continuous Spanish Lipreading in Different Data Conditions},
author = {David Gimeno-Gómez and Carlos-D. Martínez-Hinarejos},
journal= {arXiv preprint arXiv:2502.00464},
year = {2025}
}
备注
Accepted in the "Language Resources and Evaluation" journal, Springer Nature