基于可靠推理先验的多模态视频情感识别
计算机视觉与模式识别
2025-08-07 v1 人工智能
摘要
本研究探讨了将可信赖的先验推理知识从多模态大语言模型(MLLMs)集成到多模态情感识别中的方法。我们采用 Gemini 生成细粒度、可分离模态的推理痕迹,将其作为先验在融合阶段注入,以丰富跨模态交互。为缓解多模态情感识别中显著的类别不平衡问题,本文引入平衡双对比学习(Balanced Dual-Contrastive Learning),这是一种联合平衡类间和类内分布的损失函数。应用于 MER2024 基准数据集后,我们的先验增强框架获得了显著的性能提升,证明了 MLLM 源推理的可靠性与轻量级融合网络的领域适应性可以协同作用,从而实现稳健、可扩展的情感识别。
引用
@article{arxiv.2508.03722,
title = {Multimodal Video Emotion Recognition with Reliable Reasoning Priors},
author = {Zhepeng Wang and Yingjian Zhu and Guanghao Dong and Hongzhu Yi and Feng Chen and Xinming Wang and Jun Xie},
journal= {arXiv preprint arXiv:2508.03722},
year = {2025}
}
备注
preprint