ArtGPT-4:具备增强适配器的艺术理解大型视觉语言模型
计算与语言
2024-04-08 v6 计算机视觉与模式识别
摘要
大语言模型(LLMs)的成功启发了一个新兴的多模态学习研究领域。然而,利用LLMs进行多模态学习的一大挑战是预训练LLMs的规模,其通常具有数十亿参数。为应对此挑战,已开发如MiniGPT-4与LLaVA等模型,使用更少参数微调预训练模型。尽管性能可观,这些模型在艺术图像理解上仍受限。为促进更好的艺术理解,本文提出ArtGPT-4,一种开创性的大型视觉语言模型,旨在解决现有模型在艺术理解上的局限。ArtGPT-4的关键创新在于其应对艺术图像理解这一复杂挑战的精巧设计,使之区别于忽视细节而侧重宽泛主题的其他模型。具体而言,它通过向LLM中集成若干专用适配器层,使模型更高效且有效地解析与诠释复杂视觉token,而非如现有方法那样微调整个LLM。ArtGPT-4在效率上表现卓越:使用Tesla A100设备,其训练可在仅含约0.52M条图文对的数据集上于短短2小时内完成。此外,ArtGPT-4在ArtEmis与ArtEmis-v2.0数据集及本工作所建基准上均达到最先进(state-of-the-art)性能,较专业艺术家描述仅以6分制落后可忽略的0.15分。ArtGPT-4的卓越表现显示其能以艺术理解渲染图像并传达所激发的情感,与人类诠释相仿。代码与预训练模型见于 \url{https://github.com/DLYuanGod/ArtGPT-4}。
引用
@article{arxiv.2305.07490,
title = {ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter},
author = {Zhengqing Yuan and Yunhong He and Kun Wang and Yanfang Ye and Lichao Sun},
journal= {arXiv preprint arXiv:2305.07490},
year = {2024}
}