中文

SlideAVSR:用于视听语音识别的论文讲解视频数据集

计算机视觉与模式识别 2024-07-03 v2 多媒体 声音 音频与语音处理

摘要

视听语音识别(AVSR)是自动语音识别(ASR)的多模态扩展,使用视频作为音频的补充。在 AVSR 中,大量工作集中于唇读等面部特征的数据集,而这些数据集往往不足以评估更广泛语境下的图像理解能力。在本文中,我们构建了 SlideAVSR,这是一个使用科学论文讲解视频的 AVSR 数据集。SlideAVSR 提供了一个新的基准,要求模型根据演示录音中幻灯片上的文本来转录语音 utterances。由于论文讲解中频繁出现的技术术语在没有参考文本的情况下 notoriously 难以转录,我们的 SlideAVSR 数据集突出了 AVSR 问题的一个新方面。作为一个简单而有效的基线,我们提出了 DocWhisper,这是一种可以参考幻灯片文本信息的 AVSR 模型,并证实了其在 SlideAVSR 上的有效性。

关键词

引用

@article{arxiv.2401.09759,
  title  = {SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition},
  author = {Hao Wang and Shuhei Kurita and Shuichiro Shimizu and Daisuke Kawahara},
  journal= {arXiv preprint arXiv:2401.09759},
  year   = {2024}
}

备注

3rd Workshop on Advances in Language and Vision Research (ALVR 2024)