中文

基于属性引导的选择性推理与多模态大语言模型的艺术品情感理解

计算机视觉与模式识别 2026-05-18 v1

摘要

多模态大语言模型 (MLLMs) 能够生成流畅的艺术品情感解释,但它们常常遭受属性泛滥的困扰:它们枚举了许多可见的形式属性,却没有识别出哪些线索真正支持了情感判断。因此,我们将艺术品情感理解形式化为属性引导的选择性推理 (AGSR),其中预定义的形式属性作为证据单元,只有情感上起作用的属性才能进入最终解释。为了使这个问题可衡量,我们扩展了 EmoArt 数据集,该数据集最初在 ACM MM 2025 上作为包含 132,664 件艺术品的内容、形式属性、效价-唤醒度和情感标注的资源被引入,我们为其增加了一个由 15 位受过艺术训练的标注者标注的 1,400 件艺术品的人类显著性扩展集。该扩展集提供了实例级的监督,用于区分仅仅存在的属性和那些在情感上显著的属性。我们进一步提出了 FAB-G (形式属性瓶颈引导推理),这是一个有监督的多智能体框架,它首先预测属性级的显著性,然后将下游的情感分析限制在保留的线索上。实验表明,FAB-G 在情感、唤醒度和效价预测上均取得了一致的提升,在 Dice 和 Tversky 指标下与人类标记的显著属性达到了更强的一致性,并且生成的最终解释比基于提示的基线方法要紧凑得多。跨数据集评估进一步表明,属性引导的显著性选择可以迁移到 EmoArt 的源分布之外,同时也揭示了特定属性的边界情况。数据集和项目页面可在 https://zhiliangzhang.github.io/EmoArt-130k/ 获取。

关键词

引用

@article{arxiv.2605.15755,
  title  = {Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models},
  author = {Cheng Zhang and Yuer Liu and Zhiyu Zhou and Hongxia Xie and Wen-Huang Cheng},
  journal= {arXiv preprint arXiv:2605.15755},
  year   = {2026}
}