复合图像的多模态大语言模型理解:基于 CompCap 的改进
计算机视觉与模式识别
2024-12-09 v1 人工智能
机器学习
摘要
多模态大语言模型 (MLLM) 能否准确理解复合图像 (Composite Images, CIs) 仍是一个重要问题。复合图像是由合并多个视觉元素创建的合成视觉,如图表、海报或屏幕截图,而非直接由相机捕获。尽管 CIs 在现实应用中广泛存在,但最近的 MLLM 开发主要聚焦于解释自然图像 (NIs)。我们的研究表明,当前 MLLMs 在准确理解 CIs 时面临诸多挑战,常常难以从中提取信息或基于这些图像进行复杂推理。我们发现,现有的 CIs 训练数据大多为问答任务格式(例如来自 ChartQA 和 ScienceQA 等数据集),而高质量的图像-文本数据集仅限于 NIs。为弥合这一差距,我们引入复合标题 (Composite Captions, CompCap),一个灵活的框架,利用大语言模型 (LLM) 和自动化工具来合成带有准确和详细标题的 CIs。通过 CompCap,我们构建了包含 118K 张图像-标题对的 CompCap-118K 数据集,涵盖六种 CIs 类型。我们通过对三种不同规模的 MLLMs进行监督式微调验证了 CompCap-118K 的有效性:xGen-MM-inst.-4B 和 LLaVA-NeXT-Vicuna-7B/13B。经验结果表明,CompCap-118K 在 eleven 个基准任务中显著提升了 MLLMs 对 CIs 的理解能力,分别实现平均提升 1.7%、2.0% 和 2.9%。
引用
@article{arxiv.2412.05243,
title = {CompCap: Improving Multimodal Large Language Models with Composite Captions},
author = {Xiaohui Chen and Satya Narayan Shukla and Mahmoud Azab and Aashu Singh and Qifan Wang and David Yang and ShengYun Peng and Hanchao Yu and Shen Yan and Xuewen Zhang and Baosheng He},
journal= {arXiv preprint arXiv:2412.05243},
year = {2024}
}