通过说话人识别、知识蒸馏与层次融合实现多说话人对话中的情感识别
声音
2025-11-19 v1 音频与语音处理
摘要
由于说话人模糊性和严重的类别不平衡,多说话人对话中的情感识别面临重大挑战。我们提出一个新颖的框架,通过三项关键创新来解决这些问题:(1)一个利用视听同步来准确识别当前说话人的说话人识别模块;(2)一种将优越的文本情感理解迁移到音频和视觉模态的知识蒸馏策略;(3)带有复合损失函数的分层注意力融合,以处理类别不平衡。在 MELD 和 IEMOCAP 数据集上的综合评估展示了优越的性能,分别达到 67.75% 和 72.44% 的加权 F1 分数,尤其在少数情感类别上取得了显著改进。
引用
@article{arxiv.2511.13731,
title = {Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion},
author = {Xiao Li and Kotaro Funakoshi and Manabu Okumura},
journal= {arXiv preprint arXiv:2511.13731},
year = {2025}
}