中文

M$^3$AV:多模态、多类型、多用途的学术讲座音视频数据集

计算与语言 2024-06-05 v3

摘要

发布开源学术视频录像是一种新兴且流行的方法,用于在线分享知识。这类视频包含丰富的多模态信息,包括语音、演讲者的面部和身体动作,以及幻灯片中的文本和图片,甚至可能包括论文。尽管已构建并发布了多个学术视频数据集,但鲜有哪些数据集支持多模态内容的识别和理解任务,这部分原因部分源于缺乏高质量的人工标注。在本文中,我们提出一种新型的多模态、多类型和多用途的学术讲座音视频数据集(M3^3AV),该数据集几乎包含 367 小时的视频,来自五个来源,涵盖计算机科学、数学以及医学和生物学主题。通过高质量的人工标注,特别是高价值人物实体的标注,该数据集可用于多种音视频识别和理解任务。对情境语音识别、语音合成以及幻灯片和脚本生成任务的评估表明,M3^3AV 的多样性使其成为一个具有挑战性的数据集。

关键词

引用

@article{arxiv.2403.14168,
  title  = {M$^3$AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset},
  author = {Zhe Chen and Heyang Liu and Wenyi Yu and Guangzhi Sun and Hongcheng Liu and Ji Wu and Chao Zhang and Yu Wang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2403.14168},
  year   = {2024}
}

备注

ACL 2024 Main Conference. Project website: https://jack-zc8.github.io/M3AV-dataset-page