中文

HYFuse:利用双曲空间对齐异构语音预训练表征以实现语音情感识别

音频与语音处理 2025-06-05 v1

摘要

来自神经音频编解码器(如EnCodec)的基于压缩的表征(CBRs)能够捕获音高和音色等精细声学特征,而来自预训练语音表征学习模型(如WavLM)的基于表征学习的表征(RLRs)则编码高层语义和韵律信息。此前的语音情感识别(SER)研究已分别探索了两者,但CBRs和RLRs的融合尚未被探索。本研究填补了这一空白,研究了RLRs和CBRs的融合,并假设通过提供互补信息它们将更加有效。为此,我们提出了HYFuse,一个将表征转换到双曲空间以进行融合的新型框架。通过HYFuse,在融合x-vector(RLR)和Soundstream(CBR)后,我们实现了与单独表征以及RLRs和CBRs的同质融合相比的最优性能,并报告了SOTA结果。

关键词

引用

@article{arxiv.2506.03403,
  title  = {HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition},
  author = {Orchid Chetia Phukan and Girish and Mohd Mujtaba Akhtar and Swarup Ranjan Behera and Pailla Balakrishna Reddy and Arun Balaji Buduru and Rajesh Sharma},
  journal= {arXiv preprint arXiv:2506.03403},
  year   = {2025}
}

备注

Accepted to INTERSPEECH 2025