中文

MAVD:首个带深度信息的开放式大规模普通话音视数据集

声音 2023-06-06 v1 计算机视觉与模式识别

摘要

音视语音识别(AVSR)作为人机交互的重要组成部分日益受到研究者的关注。然而,现有可用的普通话音视数据集有限且缺乏深度信息。为解决此问题,本文构建了 MAVD,一个由 64 位汉语母语者讲述的 12,484 条语句组成的大规模普通话多模态语料库。为确保数据集覆盖多样的真实场景,我们开发了用于清洗和筛选原始文本材料的流程以创建均衡的朗读材料。特别地,在数据采集中除传统音频信号和 RGB 图像外,还使用了微软最新的数据采集设备 Azure Kinect 来捕获深度信息。我们还提供了基线实验,可用于评估该数据集的有效性。数据集与代码将于 https://github.com/SpringHuo/MAVD 发布。

关键词

引用

@article{arxiv.2306.02263,
  title  = {MAVD: The First Open Large-Scale Mandarin Audio-Visual Dataset with Depth Information},
  author = {Jianrong Wang and Yuchen Huo and Li Liu and Tianyi Xu and Qi Li and Sen Li},
  journal= {arXiv preprint arXiv:2306.02263},
  year   = {2023}
}