MEDUSA:面向自然条件下语音情感识别的多模态深度融合多阶段训练框架
计算与语言
2025-09-05 v2
摘要
语音情感识别(SER)是一项具有挑战性的任务,由于人类情感的主观性及其在自然条件下的不均匀分布。我们提出了 MEDUSA,一个具有四阶段训练管道的多模态框架,能够有效处理类别不平衡和情感模糊问题。前两个阶段训练一个分类器集成,利用 DeepSER——一种源自预训练自监督声学与语言表征的深度跨模态Transformer融合机制的新型扩展。Manifold MixUp 被用于进一步正则化。最后两个阶段优化一个可训练元分类器,用于融合集成预测。我们的训练方法结合了人类标注分数作为软目标,并辅以平衡数据采样和多任务学习。MEDUSA 在 Interspeech 2025:自然条件下语音情感识别挑战赛的 Task 1(类别情感识别)中排名第一。
引用
@article{arxiv.2506.09556,
title = {MEDUSA: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions},
author = {Georgios Chatzichristodoulou and Despoina Kosmopoulou and Antonios Kritikos and Anastasia Poulopoulou and Efthymios Georgiou and Athanasios Katsamanis and Vassilis Katsouros and Alexandros Potamianos},
journal= {arXiv preprint arXiv:2506.09556},
year = {2025}
}
备注
Interspeech 2025