中文

AISHELL6-whisper:带语音识别基线的中文普通话音频-视觉 Whisper 数据集

音频与语音处理 2025-09-30 v1 计算机视觉与模式识别 多媒体 声音

摘要

Whisper语音识别不仅对于确保敏感通信的隐私至关重要,还为静音患者提供了关键的沟通桥梁,使其能够在噪声敏感的环境中进行离散交互。中文普通话音频-视觉Whisper语音识别的发展受限于缺乏大规模数据集。我们提出AISHELL6-Whisper,一个大规模开源音频-视觉低语数据集,包含30小时的低语语音和平行的正常语音,配有同步的正面面部视频。此外,我们提出一种基于Whisper-Flamingo框架的音频-视觉语音识别(AVSR)基线方案,该方案集成平行训练策略以跨语音类型对齐嵌入,并采用投影层适应低语语音的频谱特性。该模型在我们数据集的测试集上实现了4.13%的字错误率(CER)用于低语语音,1.11%用于正常语音,并在wTIMIT基准上建立了新的最先进结果。该数据集和AVSR基线代码已开源于https://zutm.github.io/AISHELL6-Whisper。

关键词

引用

@article{arxiv.2509.23833,
  title  = {AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines},
  author = {Cancan Li and Fei Su and Juan Liu and Hui Bu and Yulong Wan and Hongbin Suo and Ming Li},
  journal= {arXiv preprint arXiv:2509.23833},
  year   = {2025}
}