中文

AVE Speech:面向语音识别的综合性多模态数据集,集成音频、视觉与肌电信号

声音 2025-07-08 v2 人机交互 多媒体 音频与语音处理

摘要

全球老龄化人口面临诸多挑战,尤其是在沟通方面,因听力与语言障碍的患病率较高。为此,我们介绍了 AVE Speech,这是一个用于语音识别任务的综合性多模态数据集。该数据集包含一个 100 句的普通话语料库,涵盖音频信号、嘴部区域视频录制以及六通道电位图(EMG)数据,来自 100 名受试者。每个受试者读取整个语料库十次,每句话的平均时长约为两秒, resulting in 每种模态类型累计超过 55 小时的多模态语音数据。实验表明,融合这些模态显著提升了识别性能,尤其在跨主体和高噪声环境下效果更为突出。据我们所知,这是首个公开可获取的、集成这三种模态于大规模普通话语音识别中的句子级数据集。我们期望该数据集能推动声学与非声学语音识别研究的进展,增强跨模态学习与人机交互能力。

关键词

引用

@article{arxiv.2501.16780,
  title  = {AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals},
  author = {Dongliang Zhou and Yakun Zhang and Jinghan Wu and Xingyu Zhang and Liang Xie and Erwei Yin},
  journal= {arXiv preprint arXiv:2501.16780},
  year   = {2025}
}

备注

The paper has been accepted by IEEE Transactions on Human-Machine Systems