中文

利用跨注意力Transformer和多特征融合进行跨语言语音情感识别

音频与语音处理 2025-01-22 v1 计算与语言 声音

摘要

语音情感识别(SER)在增强人机交互方面发挥着关键作用。跨语言语音情感识别(CLSER)由于不同语言在语言和声学特征上的显著差异,一直是一个充满挑战的研究问题。本研究提出了一种新方法HuMP-CAT,结合了HuBERT、MFCC和韵律特征。这些特征在特征提取过程中通过跨注意力Transformer(CAT)机制进行融合。应用迁移学习从源情感语音数据集获取目标语料库中的情感识别优势。我们使用IEMOCAP作为源数据集训练源模型,并在七个数据集(例如英语、德语、西班牙语、意大利语和中文)上评估所提出的方法。我们表明,通过对目标数据集中少量语音进行微调,HuMP-CAT在七个数据集上实现了78.75%的平均准确率,在EMODB(德语)上表现突出,达到88.69%,在EMOVO(意大利语)上达到79.48%。我们的广泛评估显示,HuMP-CAT在多个目标语言中超越了现有方法。

关键词

引用

@article{arxiv.2501.10408,
  title  = {Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition},
  author = {Ruoyu Zhao and Xiantao Jiang and F. Richard Yu and Victor C. M. Leung and Tao Wang and Shaohu Zhang},
  journal= {arXiv preprint arXiv:2501.10408},
  year   = {2025}
}