中文

CNVSRC 2024:第二届中文连续视觉语音识别挑战赛

计算机视觉与模式识别 2025-06-04 v1 声音 音频与语音处理

摘要

本文介绍了第二届中文连续视觉语音识别挑战赛(CNVSRC 2024),它在CNVSRC 2023的基础上进一步推动中文大词汇量连续视觉语音识别(LVC-VSR)的研究。该挑战赛评估两种测试场景:录音棚朗读和互联网语音。CNVSRC 2024使用与其前身CNVSRC 2023相同的数据集,包括用于训练的CN-CVS和用于开发与评估的CNVSRC-Single/Multi。然而,CNVSRC 2024引入了两项关键改进:(1)更强的基线系统,以及(2)用于开放赛道以提升数据量和多样性的额外数据集CN-CVS2-P1。新一届挑战赛在数据预处理、特征提取、模型设计和训练策略方面展现了多项重要创新,进一步推动了中文LVC-VSR的最先进水平。更多细节和资源可在官方网站获取。

关键词

引用

@article{arxiv.2506.02010,
  title  = {CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge},
  author = {Zehua Liu and Xiaolou Li and Chen Chen and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:2506.02010},
  year   = {2025}
}

备注

to be published in INTERSPEECH 2025