中文

弥合鸿沟:融合情境感知知识与视觉Transformer的高层图像分类

计算机视觉与模式识别 2026-04-20 v1 人工智能

摘要

对自动高层图像理解的需求日益增长,特别是在检测图像中的抽象概念方面,这凸显了创新且更具可解释性方法的必要性。这些方法需要协调传统的深度视觉方法与人类在复杂语义层面解释图像时所运用的、依赖于上下文的细微知识。在这项工作中,我们利用文化图像的情境感知知识来提升抽象概念图像分类的性能和可解释性。我们自动从图像中提取感知语义单元,然后对其进行建模并整合到ARTstract知识图谱中。该资源捕获了从超过14,000张标注有抽象概念的文化图像中收集到的情境感知语义。此外,我们还用高层语言框架增强了该知识图谱。我们计算知识图谱嵌入,并尝试使用相对表示以及将这些嵌入与视觉Transformer嵌入融合的混合方法。最后,为了可解释性,我们通过检查模型与训练实例的相似性进行事后定性分析。我们的结果表明,我们的混合KGE-ViT方法在抽象概念图像分类中优于现有技术。事后可解释性分析揭示了视觉Transformer在捕获像素级视觉属性方面的能力,这与我们的方法在表示更抽象和语义场景元素方面的有效性形成对比。我们展示了知识图谱嵌入的情境感知知识与深度视觉模型的感官-感知理解在抽象概念图像分类中的协同与互补作用。这项工作表明,神经符号方法在知识整合和鲁棒图像表示方面具有巨大潜力,可用于下游复杂的视觉理解任务。所有材料和代码均在线提供。

关键词

引用

@article{arxiv.2402.19339,
  title  = {Stitching Gaps: Fusing Situated Perceptual Knowledge with Vision Transformers for High-Level Image Classification},
  author = {Delfina Sol Martinez Pandiani and Nicolas Lazzari and Valentina Presutti},
  journal= {arXiv preprint arXiv:2402.19339},
  year   = {2026}
}

备注

Preprint