中文

用于语音情感识别的局部到全局特征聚合学习

声音 2023-06-05 v1

摘要

目前,Transformer 已在语音情感识别(SER)中崭露头角。然而,其等量分块划分不仅损害了频率信息,还忽略了帧间的局部情感相关性,而这是表征情感的关键线索。为了解决这个问题,我们提出了一种用于 SER 的局部到全局特征聚合学习(LGFA),它能够在帧内和片段内聚合不同尺度的长期情感相关性,并利用完整的频率信息,以增强话语级语音特征的情感区分度。为此,我们在 Segment Transformer 内部嵌套了一个 Frame Transformer。首先,Frame Transformer 被设计用于挖掘帧之间的局部情感相关性以生成帧嵌入。然后,将帧嵌入及其对应的片段特征作为不同层级的互补信息进行聚合,输入到 Segment Transformer 中以学习话语级全局情感特征。实验结果表明,LGFA 的性能优于现有最先进的方法。

关键词

引用

@article{arxiv.2306.01491,
  title  = {Learning Local to Global Feature Aggregation for Speech Emotion Recognition},
  author = {Cheng Lu and Hailun Lian and Wenming Zheng and Yuan Zong and Yan Zhao and Sunan Li},
  journal= {arXiv preprint arXiv:2306.01491},
  year   = {2023}
}

备注

This paper has been accepted on INTERSPEECH 2023