中文

Sparkles:为多模态指令跟随模型解锁跨多图像的对话能力

计算机视觉与模式识别 2024-09-18 v3 计算与语言

摘要

大语言模型在使用指令跟随数据微调后,在各类任务上的零样本性能得到增强。多模态指令跟随模型通过融合文本与图像扩展了这些能力。然而,现有如MiniGPT-4和LLaVA等模型在涉及多图像的对话场景中难以保持对话连贯性,主要原因是缺乏针对这一关键应用的专用数据集。为弥补这些不足,我们引入SparklesDialogue,首个为词级交错多图像与文本交互量身打造的机器生成对话数据集。此外,我们构建SparklesEval,一个GPT辅助的基准,用于定量评估模型跨多图像与多轮对话的会话能力。进而提出SparklesChat,一种面向多图像开放域对话的多模态指令跟随模型。实验基于MiniGPT-4和LLaVA-v1.5验证了使用SparklesDialogue训练SparklesChat的有效性:其增强了对多图像与多轮对话的理解,且未损害单图像理解能力。定性评估进一步展示了SparklesChat处理现实应用的通用性。本研究相关资源均已公开于https://github.com/HYPJUDY/Sparkles。

关键词

引用

@article{arxiv.2308.16463,
  title  = {Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following Models},
  author = {Yupan Huang and Zaiqiao Meng and Fangyu Liu and Yixuan Su and Nigel Collier and Yutong Lu},
  journal= {arXiv preprint arXiv:2308.16463},
  year   = {2024}
}

备注

ICLR 2024 Workshop (Navigating and Addressing Data Problems for Foundation Models)