Qieemo:情感识别中的语音即一切
音频与语音处理
2025-04-01 v1 人工智能
摘要
情感识别在智能人机交互系统中发挥着关键作用。多模态方法通过融合多种模态信息,能够提高识别准确率。然而,缺乏高质量的多模态数据以及实现不同模态之间最佳对齐的挑战,显著限制了多模态方法潜在的改进。本文提出的Qieemo框架有效地利用了预训练的自动语音识别(ASR)模型 backbone,其包含自然帧对齐的文本和情感特征,仅基于音频模态即可实现精确的情感分类。此外,我们设计了多模态融合(MMF)模块和跨模态注意力(CMA)模块,以融合ASR编码器提取的声学后方谱(PPG)和情感特征,以提高识别准确率。在IEMOCAP数据集上的实验结果表明,Qieemo相较于基准的单模态、多模态和自监督模型,分别实现了3.0%、1.2%和1.9%的绝对提升。
引用
@article{arxiv.2503.22687,
title = {Qieemo: Speech Is All You Need in the Emotion Recognition in Conversations},
author = {Jinming Chen and Jingyi Fang and Yuanzhong Zheng and Yaoxuan Wang and Haojun Fei},
journal= {arXiv preprint arXiv:2503.22687},
year = {2025}
}