从语音的类别型情感标签中学习唤醒度-效价表示
音频与语音处理
2024-02-07 v2
摘要
语音情感的维度表示(如唤醒度-效价(AV)表示)相比类别型表示能提供更连续且细粒度的描述与控制,在动态情感理解与富有表现力的文本到语音合成等任务中有广泛应用。现有从语音预测维度情感表示的方法将其视为有监督回归任务,这些方法面临数据稀缺问题,因为维度标注比类别标签更难获取。本工作中,我们提出从语音的类别型情感标签中学习AV表示。我们首先利用自监督预训练与情感分类微调学习一个丰富且与情感相关的高维语音特征表示,随后依据心理学发现通过锚定降维将该表示映射到二维AV空间。实验表明,我们的方法在IEMOCAP上取得了与最先进的有监督回归方法相当的 Concordance Correlation Coefficient(CCC)性能,且训练时未使用真实AV标注,这验证了我们所提出的AV预测方法。此外,在MEAD与EmoDB数据集上对AV预测的可视化显示了所学AV表示的可解释性。
引用
@article{arxiv.2311.14816,
title = {Learning Arousal-Valence Representation from Categorical Emotion Labels of Speech},
author = {Enting Zhou and You Zhang and Zhiyao Duan},
journal= {arXiv preprint arXiv:2311.14816},
year = {2024}
}