中文

如何为视觉问答配置良好的上下文序列

计算机视觉与模式识别 2023-12-05 v1 人工智能

摘要

受大语言模型在 NLP 中通过上下文学习 (ICL) 处理新任务的成功启发,研究人员也开发了具有 ICL 能力的大型视觉语言模型 (LVLMs)。然而,在使用这些 LVLMs 实现 ICL 时,研究人员通常采用最简单的方式(如随机采样)来配置上下文序列,从而导致次优结果。为了提高 ICL 性能,在本研究中,我们以视觉问答 (VQA) 为案例研究,探索多样化的上下文配置以找到强大的配置。此外,通过观察改变上下文序列时 LVLMs 输出的变化,我们深入了解了 LVLMs 的内在属性,提高了我们对它们的理解。具体而言,为了探索上下文配置,我们设计了多种检索方法,并采用不同的策略来操作检索到的示例。通过在三个 VQA 数据集:VQAv2、VizWiz 和 OK-VQA 上的详尽实验,我们揭示了所应用 LVLM 的三个重要内在属性,并证明了哪些策略可以持续提升 ICL VQA 性能。我们的代码提供于:https://github.com/GaryJiajia/OFv2_ICL_VQA。

关键词

引用

@article{arxiv.2312.01571,
  title  = {How to Configure Good In-Context Sequence for Visual Question Answering},
  author = {Li Li and Jiawei Peng and Huiyi Chen and Chongyang Gao and Xu Yang},
  journal= {arXiv preprint arXiv:2312.01571},
  year   = {2023}
}

备注

8 pages, 6 figures