中文

Vocalsound:一个用于改进人类发声声音识别的数据集

声音 2022-06-22 v2 机器学习 音频与语音处理

摘要

识别人类非言语发声是一项重要任务,并具有广泛的应用,例如自动声音转写与健康状态监测。然而,现有数据集的人声样本数量相对较少或标签含噪。因此,最先进的音频事件分类模型在检测人类发声声音时可能表现不佳。为支持构建鲁棒且准确的人声声音识别研究,我们创建了 VocalSound 数据集,包含来自 3365 名不同受试者的超过 21000 条众包录制的笑声、叹息、咳嗽、清嗓、喷嚏和吸鼻声。实验表明,将 VocalSound 数据集作为训练材料加入现有数据集,可使模型的发声声音识别性能显著提升 41.9%。此外,与先前数据集不同,VocalSound 数据集包含说话人年龄、性别、母语、国家与健康状态等元信息。

关键词

引用

@article{arxiv.2205.03433,
  title  = {Vocalsound: A Dataset for Improving Human Vocal Sounds Recognition},
  author = {Yuan Gong and Jin Yu and James Glass},
  journal= {arXiv preprint arXiv:2205.03433},
  year   = {2022}
}

备注

Accepted at ICASSP 2022. Dataset and code at https://github.com/YuanGongND/vocalsound Interactive Colab demo at https://colab.research.google.com/github/YuanGongND/vocalsound/blob/main/colab/VocalSound.ipynb