中文

VidEmo: 基于情感树推理的情感导向视频基础模型

计算机视觉与模式识别 2025-11-05 v1

摘要

理解和预测视频中的情绪近期因视频大语言模型(VideoLLM)的进步而受到广泛关注。尽管先进的方法在视频情感分析方面取得了进展,但情绪的内在本质带来了诸多挑战。情绪具有动态且依赖线索的特性,难以以合理的依据理解复杂且不断演变的情绪状态。为应对这些挑战,我们提出了一种新颖的情感线索驱动的推理框架,以阶段性方式统一基本属性感知、表情分析和高层次情感理解。在我们方法的核心是一系列视频情感基础模型(VidEmo),专为情感推理和指令跟随而设计。这些模型经过两个阶段的调优过程:首先是情感学习的课程式训练,用于注入情感知识,随后是情感树强化学习,用于情感推理。此外,我们构建了基础数据基础设施,引入了情感导向的细粒度数据集(Emo-CFG),包含 210 万个多样化的指令样本。Emo-CFG 包括可解释的情感问答、细粒度描述和相关依据,为推进情感理解任务提供了必要资源。实验结果表明,我们的方法在 15 项面部感知任务中取得了具竞争力的性能,实现了新的里程碑。

关键词

引用

@article{arxiv.2511.02712,
  title  = {VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models},
  author = {Zhicheng Zhang and Weicheng Wang and Yongjie Zhu and Wenyu Qin and Pengfei Wan and Di Zhang and Jufeng Yang},
  journal= {arXiv preprint arXiv:2511.02712},
  year   = {2025}
}

备注

41 pages, 26 figures