中文

MNV-17:面向非语言语音识别的高质量表演式普通语数据集

声音 2025-09-26 v2 人工智能 音频与语音处理

摘要

主流自动语音识别(ASR)系统擅长转换词汇内容,但在识别语音中嵌入的非语言语音(NV)时表现有限,包括叹气、笑声和咳嗽等。这种能力对全面理解人类沟通至关重要,因为 NV 传递着关键的情感和意图线索。NV-aware ASR 的进展受限于缺乏高质量、标注完善的数据集。为此,我们引入 MNV-17,一个 7.55 小时的表演式普通语语音数据集。与大多数依赖模型检测的数据集不同,MNV-17 的表演性质确保了高保真、清晰表述的 NV 实例。据我们所知,MNV-17 提供了最全套非语言语音类别,包含 17 个不同且均衡的常见 NV 类。我们在四个主流 ASR 架构上对 MNV-17 进行基准测试,评估其在语义转录和 NV 分类联合性能。该数据集和预训练模型 checkpoints 将公开发布,以促进表达式 ASR 领域的后续研究。

关键词

引用

@article{arxiv.2509.18196,
  title  = {MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech},
  author = {Jialong Mai and Jinxin Ji and Xiaofen Xing and Chen Yang and Weidong Chen and Jingyuan Xing and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2509.18196},
  year   = {2025}
}

备注

Official dataset available at: https://github.com/yongaifadian1/MNV-17. Submitted to ICASSP 2026