中文

利用时频相关性与知识迁移位置信息学习提升语谱图语音情感识别精度的方法

声音 2024-11-05 v1 计算机视觉与模式识别 音频与语音处理

摘要

本文提出一种提升语音情感识别(SER)精度的方法,通过使用视觉Transformer(ViT)关注语谱图中频率(y轴)与时间(x轴)的相关性,并通过知识迁移在ViT之间传递位置信息。所提方法具有以下创新点:i)我们使用对数梅尔语谱图的垂直分割块来分析频率随时间变化的相关性。这种分块方式使我们能够将特定情感最相关的频率与其发声时间关联起来。ii)我们提出使用图像坐标编码,一种适用于ViT的绝对位置编码。通过将图像的x、y坐标归一化至-1到1并将其与图像拼接,我们可以有效地为ViT提供有效的绝对位置信息。iii)通过特征图匹配,教师网络的位置与局部信息被有效传递给学生网络。教师网络是一个包含卷积茎局部性和通过图像坐标编码获得的绝对位置信息的ViT,而学生网络是基本ViT结构中缺少位置编码的结构。在特征图匹配阶段,我们通过平均绝对误差(L1损失)进行训练,以最小化两个网络特征图之间的差异。为验证所提方法,我们将三个由语音组成的情感数据集(SAVEE、EmoDB和CREMA-D)转换为对数梅尔语谱图进行对比实验。实验结果表明,所提方法在加权准确率上显著优于现有最优方法,同时所需的浮点运算次数(FLOPs)显著减少。总体而言,所提方法通过提供更高的效率和性能,为语音情感识别提供了一种有前景的解决方案。

关键词

引用

@article{arxiv.2403.17327,
  title  = {Accuracy enhancement method for speech emotion recognition from spectrogram using temporal frequency correlation and positional information learning through knowledge transfer},
  author = {Jeong-Yoon Kim and Seung-Ho Lee},
  journal= {arXiv preprint arXiv:2403.17327},
  year   = {2024}
}