中文

不同数据条件下端到端连续西班牙语唇读的评估

计算机视觉与模式识别 2025-02-18 v2

摘要

视觉语音识别仍然是一个开放的研究问题,由于摒弃了听觉感官,必须考虑不同的挑战,例如视觉歧义、说话者之间的个体差异以及沉默的复杂建模。尽管如此,得益于大规模数据库的可用性和强大注意力机制的使用,该领域最近取得了显著的成果。此外,除英语之外的多种语言如今也成为关注的焦点。本文展示了西班牙语自动连续唇读的显著进展。首先,提出了一种基于混合 CTC/Attention 架构的端到端系统。在两个性质迥异的语料库上进行了实验,取得了最先进的结果,显著提高了迄今为止在两个数据库上获得的最佳性能。此外,还进行了彻底的消融研究,研究了构成架构的不同组件如何影响语音识别的质量。然后,进行了严格的错误分析,以探究可能影响自动系统学习的不同因素。最后,巩固了一个新的西班牙语唇读基准。代码和训练好的模型可在 https://github.com/david-gimeno/evaluating-end2end-spanish-lipreading 获取。

关键词

引用

@article{arxiv.2502.00464,
  title  = {Evaluation of End-to-End Continuous Spanish Lipreading in Different Data Conditions},
  author = {David Gimeno-Gómez and Carlos-D. Martínez-Hinarejos},
  journal= {arXiv preprint arXiv:2502.00464},
  year   = {2025}
}

备注

Accepted in the "Language Resources and Evaluation" journal, Springer Nature