StimuVAR:基于多模态大语言模型的时空刺激感知视频情感推理
计算机视觉与模式识别
2025-06-04 v2
摘要
预测并推理视频如何影响人类情感对于开发具有社会智能的系统至关重要。尽管多模态大语言模型已展现出令人印象深刻的视频理解能力,但它们往往更侧重于视频的语义内容,而常常忽略情感刺激。因此,现有的大多数多模态大语言模型在估计观众的情感反应和提供合理解释方面存在不足。为解决这一问题,我们提出了StimuVAR,一个基于多模态大语言模型的时空刺激感知视频情感推理框架。StimuVAR包含一个两级刺激感知机制:帧级感知和令牌级感知。帧级感知涉及对包含最可能唤起观众情感事件的视频帧进行采样。令牌级感知则在令牌空间中进行管状选择,使多模态大语言模型集中于触发情感的时空区域。此外,我们创建了视频情感推理指令数据来进行情感训练,引导多模态大语言模型的推理优势转向情感焦点,从而增强其情感推理能力。为全面评估视频情感推理的有效性,我们提供了一个包含广泛指标的综合评估协议。StimuVAR是首个基于多模态大语言模型、以观众为中心的视频情感推理方法。实验证明了其在理解观众对视频的情感反应以及提供连贯且富有洞察力的解释方面的优越性。我们的代码可在https://github.com/EthanG97/StimuVAR获取。
引用
@article{arxiv.2409.00304,
title = {StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models},
author = {Yuxiang Guo and Faizan Siddiqui and Yang Zhao and Rama Chellappa and Shao-Yuan Lo},
journal= {arXiv preprint arXiv:2409.00304},
year = {2025}
}
备注
Paper is accepted by IJCV