A-MAR:面向细粒度艺术品理解的基于智能体的多模态艺术检索
人工智能
2026-04-22 v1
摘要
理解艺术品需要对视觉内容以及文化、历史和风格语境进行多步推理。尽管近期的多模态大语言模型在艺术品解释方面展现出潜力,但它们依赖于隐式推理和内化知识,限制了可解释性和显式证据基础。我们提出了A-MAR,一种基于智能体的多模态艺术检索框架,该框架显式地以结构化推理计划为检索条件。给定一件艺术品和一个用户查询,A-MAR首先将任务分解为一个结构化推理计划,明确每步的目标和证据需求。随后,检索以该计划为条件,从而实现有针对性的证据选择,并支持逐步的、有根据的解释。为了评估艺术领域内基于智能体的多模态推理,我们引入了ArtCoT-QA。这一诊断基准针对多样化的艺术相关查询提供了多步推理链,能够进行超越简单的最终答案准确率的细粒度分析。在SemArt和Artpedia上的实验表明,A-MAR在最终解释质量上始终优于静态、无计划的检索以及强大的MLLM基线,而在ArtCoT-QA上的评估进一步证明了其在证据基础和多步推理能力方面的优势。这些结果突出了推理条件检索对于知识密集型多模态理解的重要性,并将A-MAR定位为迈向可解释的、目标驱动的AI系统的一步,对文化产业具有特殊意义。代码和数据可在以下地址获取:https://github.com/ShuaiWang97/A-MAR。
引用
@article{arxiv.2604.19689,
title = {A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding},
author = {Shuai Wang and Hongyi Zhu and Jia-Hong Huang and Yixian Shen and Chengxi Zeng and Stevan Rudinac and Monika Kackovic and Nachoem Wijnberg and Marcel Worring},
journal= {arXiv preprint arXiv:2604.19689},
year = {2026}
}