中文

VSR模型能否泛化到LRS3之外?

计算机视觉与模式识别 2023-11-27 v1 计算与语言 机器学习

摘要

唇读语句-3(LRS3)基准在过去几年中一直是视觉语音识别(VSR)研究的主要焦点。因此,对其过度使用的、仅为一小时时长的测试集存在过拟合的加剧风险。为缓解此问题,我们紧密遵循LRS3数据集创建流程构建了一个名为WildVSR的新VSR测试集。随后我们评估并分析了当前VSR模型对新测试数据的泛化程度。我们评估了广泛的公开可用VSR模型,发现相较于其对应的LRS3结果,在我们的测试集上性能显著下降。我们的结果表明,词错误率的上升源于模型无法泛化到比LRS3测试集中稍难且真实场景下的唇部序列。我们的新测试基准已公开,以促进未来朝向更鲁棒VSR模型的研究。

关键词

引用

@article{arxiv.2311.14063,
  title  = {Do VSR Models Generalize Beyond LRS3?},
  author = {Yasser Abdelaziz Dahou Djilali and Sanath Narayan and Eustache Le Bihan and Haithem Boussaid and Ebtessam Almazrouei and Merouane Debbah},
  journal= {arXiv preprint arXiv:2311.14063},
  year   = {2023}
}