MNV-17:面向非语言语音识别的高质量表演式普通语数据集
声音
2025-09-26 v2 人工智能
音频与语音处理
摘要
主流自动语音识别(ASR)系统擅长转换词汇内容,但在识别语音中嵌入的非语言语音(NV)时表现有限,包括叹气、笑声和咳嗽等。这种能力对全面理解人类沟通至关重要,因为 NV 传递着关键的情感和意图线索。NV-aware ASR 的进展受限于缺乏高质量、标注完善的数据集。为此,我们引入 MNV-17,一个 7.55 小时的表演式普通语语音数据集。与大多数依赖模型检测的数据集不同,MNV-17 的表演性质确保了高保真、清晰表述的 NV 实例。据我们所知,MNV-17 提供了最全套非语言语音类别,包含 17 个不同且均衡的常见 NV 类。我们在四个主流 ASR 架构上对 MNV-17 进行基准测试,评估其在语义转录和 NV 分类联合性能。该数据集和预训练模型 checkpoints 将公开发布,以促进表达式 ASR 领域的后续研究。
引用
@article{arxiv.2509.18196,
title = {MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech},
author = {Jialong Mai and Jinxin Ji and Xiaofen Xing and Chen Yang and Weidong Chen and Jingyuan Xing and Xiangmin Xu},
journal= {arXiv preprint arXiv:2509.18196},
year = {2025}
}
备注
Official dataset available at: https://github.com/yongaifadian1/MNV-17. Submitted to ICASSP 2026