中文

面向非语音语音生成与理解的可扩展管道

声音 2026-01-14 v2 音频与语音处理

摘要

非语音 Vocalizations (NVs),如笑声和叹气,是表达情感和意图在人类语言中的关键要素,但大多数现有语音系统忽略它们,严重损害了交际丰富性和情感智能。现有方法要么昂贵且不可扩展(依赖人工标注/录制),要么不自然(依赖基于规则的合成)。为此,我们提出一个高度可扩展的自动标注框架,用于从自然语音中标记非语音现象,具有低成本、易扩展性,以及天然的多样性和自然性。该框架利用统一的检测模型准确识别自然语音中的 NVs,并通过时序-语义对齐方法将其与 transcript 集成。使用该框架,我们创建并发布了 \textbf{NonVerbalSpeech-38K},一个来自野生媒体的多样化、真实世界数据集,包含 38,718 个样本,覆盖 10 种 NVs 类别。实验结果表明,我们的数据集为 NVs 生成提供了优越的可控性,并在 NVs 理解方面实现了可比性能。

关键词

引用

@article{arxiv.2508.05385,
  title  = {A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding},
  author = {Runchuan Ye and Yixuan Zhou and Renjie Yu and Zijian Lin and Kehan Li and Xiang Li and Xin Liu and Guoyang Zeng and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2508.05385},
  year   = {2026}
}