GalleryGPT:利用大型多模态模型分析绘画
计算与语言
2024-08-02 v1 计算机视觉与模式识别
多媒体
摘要
艺术作品分析是艺术欣赏的重要基础技能,能够丰富个人的审美感受力并促进批判性思维能力。由于其主观性、多样化的解释和复杂的视觉元素,理解艺术作品具有挑战性,需要艺术史、文化背景和美学理论方面的专业知识。然而,受限于数据收集和模型能力,此前用于自动分析艺术作品的工作主要聚焦于分类、检索等简单任务,这与AI的目标相去甚远。为了推动研究进展,本文进一步提出了受大型多模态模型卓越的感知和生成能力启发的综合分析任务。具体而言,我们首先提出了针对艺术作品的段落分析任务,即本文中的绘画分析,仅关注视觉特征以形成对艺术作品更全面的理解。为了支持形式分析的研究,我们收集了一个大型数据集PaintingForm,包含约19k幅绘画图像和50k段分析段落。我们进一步引入了一种优越的大型多模态模型用于绘画分析段落生成,命名为GalleryGPT,该模型基于LLaVA架构进行轻微修改并利用我们收集的数据进行微调。我们在多个数据集上进行了形式分析生成和零样本实验,以评估我们模型的能力。结果表明,与强大的基线LMMs相比取得了显著的性能提升,证明了其在艺术分析和泛化方面的卓越能力。\textcolor{blue}{代码和模型可在以下地址获取:https://github.com/steven640pixel/GalleryGPT.
引用
@article{arxiv.2408.00491,
title = {GalleryGPT: Analyzing Paintings with Large Multimodal Models},
author = {Yi Bin and Wenhao Shi and Yujuan Ding and Zhiqiang Hu and Zheng Wang and Yang Yang and See-Kiong Ng and Heng Tao Shen},
journal= {arXiv preprint arXiv:2408.00491},
year = {2024}
}
备注
Accepted as Oral Presentation at ACM Multimedia 2024