AffectSpeech: 一个大规模情感语音数据集及其细粒度文本描述,用于语音情感描述与合成
音频与语音处理
2026-04-07 v1 声音
信号处理
摘要
情感在口语交流中至关重要,但大多数现有的语音情感建模框架依赖于预定义类别或低维连续属性,表达能力有限。语音情感描述与合成的最新进展表明,文本描述为表示语音中的情感特征提供了一种更灵活且可解释的替代方案。然而,该方向的进展受到缺乏与可靠且细粒度的自然语言标注对齐的情感语音数据集的制约。为此,我们提出 AffectSpeech,一个大规模的人类录制语音语料库,包含结构化描述以支持细粒度情感分析与生成。每个话语在六个互补维度上进行刻画,包括情感极性、开放词汇情感描述、强度等级、韵律属性、显著片段和语义内容,从而实现多粒度语音表达建模。为平衡标注质量与可扩展性,我们采用人机-大语言模型协作标注流程,融合算法预标注、多大语言模型描述生成以及人工闭环验证。此外,这些标注被重构为多样化的描述风格,以增强语言多样性并降低下游建模中的风格偏差。在语音情感描述与合成上的实验结果表明,基于 AffectSpeech 训练的模型在多种评估设置下始终取得优越性能。
引用
@article{arxiv.2604.04160,
title = {AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis},
author = {Tianhua Qi and Wenming Zheng and Björn W. Schuller and Zhaojie Luo and Haizhou Li},
journal= {arXiv preprint arXiv:2604.04160},
year = {2026}
}
备注
Submitted to IEEE Transactions