基于视觉语言推理的博物馆展品理解
计算机视觉与模式识别
2025-09-10 v2 计算与语言
摘要
博物馆作为文化遗产和历史文物的储存库,保存着来自不同时代、文明和地区的密集且经过整理的收藏品,蕴含着广泛的知识。将其系统化地整理为大规模数据集后,可用于训练专门的模型。游客通过好奇心和提问与展品互动,因此需要专业的领域特定模型来解决交互查询并获取历史见解。从图像中理解展品需要分析视觉特征并将其与历史知识关联,以派生有意义的联系。我们通过以下方式实现了此类推理:(a) 收集和整理了来自全球各地约 6500 万张展品图像和 2 亿个问答对的大规模数据集;(b) 在收集的数据集上训练大型视觉语言模型(VLMs);(c) 对其在五个视觉问答任务上的能力进行基准测试,这些任务特别设计以反映博物馆场景中观察到的实际问题和挑战。该完整数据集由博物馆专家标注,确保标签的质量和实际意义。我们训练了两类 VLMs:一种是 BLIP 模型,采用视觉语言对齐嵌入,但缺乏大型语言模型的表达能力;另一种是 LLaVA 模型,这是一种强大的指令微调大语言模型,增强了视觉语言推理能力。通过大量实验,我们发现尽管两种模型类型都能有效回答视觉 grounding 的问题,但大型视觉语言模型在需要更深入历史背景和推理的查询方面表现更佳。我们进一步通过在大规模领域特定数据集上进行微调,展示了对当前 SOTA VLMs 在解答特定属性问题方面的显著优势,凸显了其在处理复杂、细微查询方面的局限性。
引用
@article{arxiv.2412.01370,
title = {Understanding Museum Exhibits using Vision-Language Reasoning},
author = {Ada-Astrid Balauca and Sanjana Garai and Stefan Balauca and Rasesh Udayakumar Shetty and Naitik Agrawal and Dhwanil Subhashbhai Shah and Yuqian Fu and Xi Wang and Kristina Toutanova and Danda Pani Paudel and Luc Van Gool},
journal= {arXiv preprint arXiv:2412.01370},
year = {2025}
}
备注
Accepted at ICCV 2025