MFHCA:通过多空间融合和层次协作注意力提升语音情感识别
声音
2024-04-23 v1 人工智能
音频与语音处理
摘要
语音情感识别是人机交互中的关键任务,但从音频中提取和利用情感线索存在挑战。本文介绍了 MFHCA,即一种新型语音情感识别方法,基于多空间融合和层次协作注意力处理语谱图和原始音频。我们采用多空间融合模块(MF)高效识别情感相关的语谱区域,并整合 Hubert 特征以获取更高层次的声学信息。我们的 方法还包括层次协作注意力模块(HCA),用于整合来自各种听觉层次的特征。我们在 IEMOCAP 数据集上评估了该方法,在加权准确率和不加权准确率上分别实现了 2.6% 和 1.87% 的提升。广泛的实验表明,所提出的方法有效。
引用
@article{arxiv.2404.13509,
title = {MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention},
author = {Xinxin Jiao and Liejun Wang and Yinfeng Yu},
journal= {arXiv preprint arXiv:2404.13509},
year = {2024}
}
备注
Main paper (5 pages). Accepted for publication by ICME 2024