中文

将艺术图像引发的社会概念作为多模态框架进行自动建模

计算机视觉与模式识别 2026-04-20 v1 计算与语言 数字图书馆 社会与信息网络

摘要

指代非物理对象的社会概念——如革命、暴力或友谊——是描述、索引和查询视觉数据内容的强大工具,包括文化遗产(CH)领域不断增长的艺术图像收藏。尽管在计算机视觉领域朝着完全的图像理解取得了很大进展,但自动检测图像所引发的社会概念仍然是一个挑战。部分原因在于众所周知的语义鸿沟问题,对于社会概念而言,由于它们缺乏独特的物理特征,且比具体概念更依赖于非特定特征,这一问题更加严重。在本文中,我们提出将关于社会概念表征的最新认知理论转化为一种软件方法,通过整合多感官数据将它们表示为多模态框架。我们的方法侧重于从标记有感兴趣概念的艺术视觉材料中提取、分析和整合多模态特征。我们定义了一个概念模型,并提出了一种新的本体,用于将社会概念形式化地表示为多模态框架。以泰特美术馆的收藏为实证基础,我们在艺术图像语料库上实验了我们的方法,以提供其潜力的概念验证。我们讨论了进一步的研究方向,并提供了所有的软件、数据源和结果。

关键词

引用

@article{arxiv.2110.07420,
  title  = {Automatic Modeling of Social Concepts Evoked by Art Images as Multimodal Frames},
  author = {Delfina Sol Martinez Pandiani and Valentina Presutti},
  journal= {arXiv preprint arXiv:2110.07420},
  year   = {2026}
}

备注

First International Workshop on Multisensory Data and Knowledge at the 3rd Conference on Language, Data and Knowledge (2021)