Emotion-LLaMAv2 与 MMEVerse:面向多模态情感理解的全新框架与基准
计算机视觉与模式识别
2026-02-24 v2 人工智能
摘要
从多模态信号中理解人类情感是情感计算和人机交互中的重要挑战。虽然多模态大语言模型(MLLM)在通用视觉语言任务中表现突出,但其在情感推理方面的能力仍受限。该领域目前存在大规模高质量情感标注数据稀缺、缺乏标准化评估基准的两大问题。我们先前提出的Emotion-LLaMA框架通过指令微调实现了情感推理的多模态学习,但受限于显式人脸检测器、隐式融合策略以及数据质量低、规模有限。为此,我们提出Emotion-LLaMAv2和MMEVerse基准,构建了完整的端到端管道,并制定了标准化的评估设置,用于情感识别与推理。Emotion-LLaMAv2包含三项关键创新:其一,端到端的多视角编码器消除外部人脸检测,利用更丰富的空间和时间多视角token捕捉细微的情感线索;其二,设计Conv Attention预融合模块,实现LLM骨架外部的局部与全局多模态特征的同步互动;其三,在LLaMA2骨架中构建感知到认知的课程指令微调方案,统一情感识别与自由形式情感推理。为支持大规模训练和可重复的评估,MMEVerse将12个公开的情感数据集(包括IEMOCAP、MELD、DFEW和MAFW)整合为统一的多模态指令格式。该数据经由包含Qwen2 Audio、Qwen2.5 VL和GPT-4o的多智能体管道重新标注,生成13万条训练样本和3.6万条测试样本,覆盖18个评估基准。
引用
@article{arxiv.2601.16449,
title = {Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding},
author = {Xiaojiang Peng and Jingyi Chen and Zebang Cheng and Bao Peng and Fengyi Wu and Yifei Dong and Shuyuan Tu and Qiyu Hu and Huiting Huang and Yuxiang Lin and Jun-Yan He and Kai Wang and Zheng Lian and Zhi-Qi Cheng},
journal= {arXiv preprint arXiv:2601.16449},
year = {2026}
}