中文

四元数域中的语音情感表示学习

音频与语音处理 2023-03-06 v2 机器学习 声音

摘要

对语音信号中人类情感表达的建模是一项重要但具有挑战性的任务。语音情感识别模型的高资源需求,加上情感标注数据普遍稀缺,是该领域有效解决方案开发与应用的障碍。本文中,我们提出一种联合规避这些困难的方法。我们的方法名为 RH-emo,是一种新颖的半监督架构,旨在从实值单耳谱图提取四元数嵌入,从而能够使用四元数值网络进行语音情感识别任务。RH-emo 是一种实/四元数混合自编码器网络,由与实值情感分类器和四元数解码器并行运行的实值编码器组成。一方面,分类器允许针对特定情感相关特征(效价、唤醒度、支配度和整体情感)的分类优化嵌入的每个潜在轴。另一方面,四元数重建使潜在维度能够发展出作为四元数实体有效表示所需的通道内相关性。我们在语音情感识别任务上使用四个流行数据集(Iemocap、Ravdess、EmoDb 和 Tess)测试我们的方法,比较三种成熟的实值 CNN 架构(AlexNet、ResNet-50、VGG)及其由 RH-emo 生成的嵌入所馈入的四元数值等价模型的性能。我们在所有数据集上获得测试精度的一致提升,同时大幅降低模型的资源需求。此外,我们进行了额外实验和消融研究,证实了方法的有效性。RH-emo 代码库位于:https://github.com/ispamm/rhemo。

关键词

引用

@article{arxiv.2204.02385,
  title  = {Learning Speech Emotion Representations in the Quaternion Domain},
  author = {Eric Guizzo and Tillman Weyde and Simone Scardapane and Danilo Comminiello},
  journal= {arXiv preprint arXiv:2204.02385},
  year   = {2023}
}

备注

Accepted for Publication in IEEE/ACM Transactions on Audio, Speech and Language Processing