SatireDecoder:用于提升讽刺图像理解的视觉级联解耦
计算机视觉与模式识别
2025-12-02 v1
摘要
讽刺作为一种将幽默与隐式批评结合的艺术表达形式,具有重要的社会价值,通过显露社会问题实现价值。尽管其文化和社会意义显著,讽刺理解,尤其是纯粹视觉形式的讽刺理解,仍是当前视觉语言模型面临的挑战。该任务不仅需要检测讽刺,还需要解读其细微含义并识别所涉及实体。现有模型往往无法有效整合局部实体关系与全局语境,导致误解、理解偏差和幻觉。为此,我们提出了 SatireDecoder,一个旨在增强讽刺图像理解的无训练框架。我们的方法提出了一个多智能体系统,执行视觉级联解耦,将图像分解为细粒度的局部和全局语义表示。此外,我们引入一种由不确定性分析引导的链式思维推理策略,将复杂的讽刺理解过程分解为次序次要任务并最大程度降低不确定性。我们的方法显著提高了解释准确性,同时减少了幻觉。实验结果表明,SatireDecoder 在理解视觉讽刺方面超越了现有基线,为视觉语言推理在细致、高层语义任务中提供了有前景的方向。
引用
@article{arxiv.2512.00582,
title = {SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension},
author = {Yue Jiang and Haiwei Xue and Minghao Han and Mingcheng Li and Xiaolu Hou and Dingkang Yang and Lihua Zhang and Xu Zheng},
journal= {arXiv preprint arXiv:2512.00582},
year = {2025}
}
备注
Accepted by AAAI 2026