将艺术图像引发的社会概念作为多模态框架进行自动建模
计算机视觉与模式识别
2026-04-20 v1 计算与语言
数字图书馆
社会与信息网络
摘要
指代非物理对象的社会概念——如革命、暴力或友谊——是描述、索引和查询视觉数据内容的强大工具,包括文化遗产(CH)领域不断增长的艺术图像收藏。尽管在计算机视觉领域朝着完全的图像理解取得了很大进展,但自动检测图像所引发的社会概念仍然是一个挑战。部分原因在于众所周知的语义鸿沟问题,对于社会概念而言,由于它们缺乏独特的物理特征,且比具体概念更依赖于非特定特征,这一问题更加严重。在本文中,我们提出将关于社会概念表征的最新认知理论转化为一种软件方法,通过整合多感官数据将它们表示为多模态框架。我们的方法侧重于从标记有感兴趣概念的艺术视觉材料中提取、分析和整合多模态特征。我们定义了一个概念模型,并提出了一种新的本体,用于将社会概念形式化地表示为多模态框架。以泰特美术馆的收藏为实证基础,我们在艺术图像语料库上实验了我们的方法,以提供其潜力的概念验证。我们讨论了进一步的研究方向,并提供了所有的软件、数据源和结果。
引用
@article{arxiv.2110.07420,
title = {Automatic Modeling of Social Concepts Evoked by Art Images as Multimodal Frames},
author = {Delfina Sol Martinez Pandiani and Valentina Presutti},
journal= {arXiv preprint arXiv:2110.07420},
year = {2026}
}
备注
First International Workshop on Multisensory Data and Knowledge at the 3rd Conference on Language, Data and Knowledge (2021)