SlideAVSR:用于视听语音识别的论文讲解视频数据集
计算机视觉与模式识别
2024-07-03 v2 多媒体
声音
音频与语音处理
摘要
视听语音识别(AVSR)是自动语音识别(ASR)的多模态扩展,使用视频作为音频的补充。在 AVSR 中,大量工作集中于唇读等面部特征的数据集,而这些数据集往往不足以评估更广泛语境下的图像理解能力。在本文中,我们构建了 SlideAVSR,这是一个使用科学论文讲解视频的 AVSR 数据集。SlideAVSR 提供了一个新的基准,要求模型根据演示录音中幻灯片上的文本来转录语音 utterances。由于论文讲解中频繁出现的技术术语在没有参考文本的情况下 notoriously 难以转录,我们的 SlideAVSR 数据集突出了 AVSR 问题的一个新方面。作为一个简单而有效的基线,我们提出了 DocWhisper,这是一种可以参考幻灯片文本信息的 AVSR 模型,并证实了其在 SlideAVSR 上的有效性。
引用
@article{arxiv.2401.09759,
title = {SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition},
author = {Hao Wang and Shuhei Kurita and Shuichiro Shimizu and Daisuke Kawahara},
journal= {arXiv preprint arXiv:2401.09759},
year = {2024}
}
备注
3rd Workshop on Advances in Language and Vision Research (ALVR 2024)