ArtSeek:基于多模态情境推理与晚期交互检索的深度艺术品理解框架
计算机视觉与模式识别
2025-07-30 v1
摘要
分析数字化艺术品呈现独特挑战,既需要视觉解释,也需要对丰富的艺术、情境和历史知识的深入理解。我们引入ArtSeek,一个用于艺术分析的多模态框架,将多模态大语言模型与检索增强生成相结合。不同于先前工作,our pipeline仅依赖图像输入,使其适用于大多数数字化收藏中缺乏与Wikidata或Wikipedia关联的艺术品。ArtSeek集成了三个关键组件:基于晚期交互检索的智能多模态检索模块、用于预测艺术家、流派、风格、媒介和标签的对比多任务分类网络,以及通过Qwen2.5-VL实现的智能体式推理策略,通过情境示例支持复杂的视觉问答和艺术品解释。WikiFragments是一个规模为维基百科的数据集,收集了图像-文本片段,以支持知识驱动的多模态推理。我们的框架在多个基准测试中实现了最先进的结果,包括在风格分类上相较于GraphCLIP提升8.4个百分点F1分数,在ArtPedia上的captioning任务中BLEU@1提升7.1分。定性分析表明,ArtSeek能够解释视觉图腾,推断历史背景,检索相关知识,即便针对陌生作品亦如此。虽然聚焦于视觉艺术,但我们的ethods可推广至其他需要外部知识的领域,支持可扩展的多模态AI研究。该数据集和源代码将公开发布于https://github.com/cilabuniba/artseek。
引用
@article{arxiv.2507.21917,
title = {ArtSeek: Deep artwork understanding via multimodal in-context reasoning and late interaction retrieval},
author = {Nicola Fanelli and Gennaro Vessio and Giovanna Castellano},
journal= {arXiv preprint arXiv:2507.21917},
year = {2025}
}