中文

EmoSEM:视觉艺术情感刺激的分段与解释

计算机视觉与模式识别 2025-08-20 v3

摘要

本文聚焦于视觉情感理解的关键挑战:给定一张艺术图像,模型在像素级别定位触发特定人类情感的区域,并生成相应的语言解释。尽管通用分割技术已取得进展,像素级情感理解仍面临双重挑战:其一,情感的主观性限制了像SAM等通用分割模型适应情感导向分割任务;其二,艺术表达的抽象性使得说明模型难以在像素级语义与情感推理之间取得平衡。为解决上述问题,本文提出情感刺激分段与解释模型(EmoSEM),为分割框架赋予情感理解能力。首先,引入带可学习掩码记号的情感提示,作为分割解码的条件输入。随后,设计情感投影器以建立情感与视觉特征之间的关联。更为重要的是,为解决情感-视觉刺激对齐问题,开发轻量级前缀适配器,该模块将所学情感掩码与对应情感融合为与语言模型兼容的统一表示。最终,将联合的视觉、掩码和情感记号输入语言模型,输出情感解释。确保生成的解释在语义和情感上与视觉刺激保持一致。我们的方法实现了从低级像素特征到高级情感解释的端到端建模,构建了视觉情感分析的首个可解释的细粒度框架。大量实验验证了模型的有效性。代码将公开释放。

关键词

引用

@article{arxiv.2504.14658,
  title  = {EmoSEM: Segment and Explain Emotion Stimuli in Visual Art},
  author = {Jing Zhang and Dan Guo and Zhangbin Li and Meng Wang},
  journal= {arXiv preprint arXiv:2504.14658},
  year   = {2025}
}