中文

SQ-LLaVA:面向大型视觉语言助手的自我提问

计算机视觉与模式识别 2024-07-16 v2 人工智能 计算与语言 机器学习

摘要

视觉语言模型的最新进展表明,通过视觉指令微调,其在广泛任务中展现出显著的泛化能力。然而,弥合预训练视觉编码器与大型语言模型(LLMs)之间的差距成为了整个网络的瓶颈。为了改善跨模态对齐,现有工作通常考虑使用涵盖更广泛视觉任务的更多视觉指令数据来微调模型以进行问答,但获取这些数据成本高昂,且未能充分探索图像中包含的丰富上下文信息。本文首次尝试利用视觉指令数据中被忽视的上下文,训练模型自监督地“学习”如何提出高质量问题。通过这种方式,我们引入了一个名为 SQ-LLaVA 的新框架:面向大型视觉语言助手的自我提问。SQ-LLaVA 展现了在分析视觉线索和先验语言知识的同时,生成灵活且有意义的图像相关问题的能力,这标志着广义视觉理解的先进水平。此外,在更高质量的指令数据上微调 SQ-LLaVA 表明,与传统的视觉指令微调方法相比,其性能有所提升。这一提升突显了自我提问技术在实现对各种上下文中视觉内容更深入、更细致理解方面的有效性。

关键词

引用

@article{arxiv.2403.11299,
  title  = {SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant},
  author = {Guohao Sun and Can Qin and Jiamian Wang and Zeyuan Chen and Ran Xu and Zhiqiang Tao},
  journal= {arXiv preprint arXiv:2403.11299},
  year   = {2024}
}

备注

ECCV 2024