中文

NVSpeech:用于带有副语言声音的人类化语音建模的集成可扩展管道

声音 2025-08-07 v1 人工智能 机器学习

摘要

副语言声音(包括非语言声音,如笑声和呼吸声,以及词汇化感叹词,如"uhm"和"oh")是自然口头交流中不可或缺的组成部分。尽管这些声音在传递情感、意图和交互线索方面至关重要,但在传统自动语音识别(ASR)和文本转语音(TTS)系统中仍被大体忽略。我们提出了NVSpeech,这是一个集成可扩展的管道,用于副语言声音的识别和合成,涵盖数据集构建、ASR建模和可控TTS。(1)我们引入了一个包含48,430个人类语音utterances并标注了18个词级副语言类别的数据集。(2)我们开发了副语言感知ASR模型,将副语言线索视为内联可解码标记(例如,"You're so funny [Laughter]"),从而实现词汇和非语言转录的联合建模。该模型用于自动标注大型语料库,首个大规模中文数据集包含174,179个utterances(573小时),并提供词级对齐和副语言标注。(3)我们在人工标注和自动标注数据上对零样法TTS模型进行微调,实现对副语言声音的显式控制,允许在任意token位置进行上下文感知的插入,从而实现人类化语音合成。通过统一副语言声音的识别和生成,NVSpeech提供了第一个开放的、大规模的、词级标注的管道,用于中文表达语音建模,实现了可扩展且可控的识别和合成。数据集和音频演示可在https://nvspeech170k.github.io/上访问。

关键词

引用

@article{arxiv.2508.04195,
  title  = {NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations},
  author = {Huan Liao and Qinke Ni and Yuancheng Wang and Yiheng Lu and Haoyue Zhan and Pengyuan Xie and Qiang Zhang and Zhizheng Wu},
  journal= {arXiv preprint arXiv:2508.04195},
  year   = {2025}
}