CNVSRC 2024:第二届中文连续视觉语音识别挑战赛
计算机视觉与模式识别
2025-06-04 v1 声音
音频与语音处理
摘要
本文介绍了第二届中文连续视觉语音识别挑战赛(CNVSRC 2024),它在CNVSRC 2023的基础上进一步推动中文大词汇量连续视觉语音识别(LVC-VSR)的研究。该挑战赛评估两种测试场景:录音棚朗读和互联网语音。CNVSRC 2024使用与其前身CNVSRC 2023相同的数据集,包括用于训练的CN-CVS和用于开发与评估的CNVSRC-Single/Multi。然而,CNVSRC 2024引入了两项关键改进:(1)更强的基线系统,以及(2)用于开放赛道以提升数据量和多样性的额外数据集CN-CVS2-P1。新一届挑战赛在数据预处理、特征提取、模型设计和训练策略方面展现了多项重要创新,进一步推动了中文LVC-VSR的最先进水平。更多细节和资源可在官方网站获取。
引用
@article{arxiv.2506.02010,
title = {CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge},
author = {Zehua Liu and Xiaolou Li and Chen Chen and Lantian Li and Dong Wang},
journal= {arXiv preprint arXiv:2506.02010},
year = {2025}
}
备注
to be published in INTERSPEECH 2025