以视觉原型为基础的情感识别:VEGA -- 重访 MERC 中的 CLIP
计算机视觉与模式识别
2025-08-14 v2
摘要
多模态情感识别在对话中仍是一个具有挑战性的任务,由于文本、声学和视觉信号之间存在复杂的相互作用。虽然最近的模型通过先进的融合策略提高了性能,但往往缺乏引导多模态对齐的心理学意义上的先验条件。在本文中,我们重新审视 CLIP 的使用,提出一种新的视觉情感引导锚� (VEGA) 机制,将类级别的视觉语义引入融合和分类过程中。与先前主要利用 CLIP 文本编码器的工作不同,我们的方法利用其图像编码器基于面部样本构建情感特定的视觉锚点。这些锚点引导单模态和多模态特征向感知上 grounding 且心理学上对齐的表示空间发展,灵感来自认知理论(原型情感类别和多感官整合)。进一步的随机锚点抽样策略通过平衡语义稳定性和类内多样性来增强鲁棒性。集成到具有自蒸馈的双分支架构中,我们的 VEGA 增强模型在 IEMOCAP 和 MELD 上实现了 SOTA 性能。代码可在 https://github.com/dkollias/VEGA 获取。
引用
@article{arxiv.2508.06564,
title = {Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC},
author = {Guanyu Hu and Dimitrios Kollias and Xinyu Yang},
journal= {arXiv preprint arXiv:2508.06564},
year = {2025}
}
备注
accepted for publication at ACM Multimedia (ACM MM) 2025