中文

Omni-SILA:面向 Omni-scene 驱动的视频视觉情感识别、定位与归因

计算机视觉与模式识别 2025-03-04 v1 人工智能

摘要

先前的视觉情感理解(VSU)研究主要依赖显式场景信息(如面部表情)来判断视觉情感,而大幅忽略了隐式场景信息(如人类动作、物体关系和视觉背景),而此类信息对于精确发现视觉情感至关重要。为此,本文提出了新的 Omni-scene 驱动的视觉情感识别、定位与归因(Omni-SILA)任务,旨在通过显式和隐式场景信息交互式且精确地识别、定位和归因视觉情感。此外,本文认为,Omni-SILA 任务面临两个关键挑战:建模场景信息以及突出显式信息之外的隐式场景。为此,本文提出了用于解决 Omni-SILA 任务的隐式增强因果混合专家(Implicit-enhanced Causal MoE, ICM)方法。具体而言,针对建模场景信息和突显显式信息之外的隐式场景信息,分别设计了场景平衡混合专家(Scene-Balanced MoE, SBM)和隐式增强因果(Implicit-Enhanced Causal, IEC)模块。针对我们构建的显式和隐式 Omni-SILA 数据集进行的大量实验结果表明,所提出的 ICM 方法在先进的 Video-LLM 方面具有显著优势。

关键词

引用

@article{arxiv.2503.00049,
  title  = {Omni-SILA: Towards Omni-scene Driven Visual Sentiment Identifying, Locating and Attributing in Videos},
  author = {Jiamin Luo and Jingjing Wang and Junxiao Ma and Yujie Jin and Shoushan Li and Guodong Zhou},
  journal= {arXiv preprint arXiv:2503.00049},
  year   = {2025}
}