中文

好问题助力零样本图像推理

计算机视觉与模式识别 2023-12-12 v2

摘要

将近期大型语言模型(LLM)与计算机视觉模型对齐,催生了大型视觉-语言模型(LVLM),为零样本图像推理任务铺平了道路。然而,LVLM通常仅在稀疏关注区域的短高层级描述上训练。这种“隧道视野”限制了LVLM探索复杂场景中其他相关上下文的能力。为解决这一挑战,我们引入了问题驱动的视觉探索(QVix),一种新颖的提示策略,旨在增强LVLM在零样本推理任务中的探索能力。QVix利用LLM强大的语言先验,生成比原始查询更详细的输入探索性问题,引导LVLM更全面地探索视觉内容,发现细微或外围细节。QVix实现了对视觉场景的更广泛探索,提升了LVLM在视觉问答和视觉蕴含等任务中的推理准确性和深度。我们在多个具有挑战性的零样本视觉-语言基准(包括ScienceQA和细粒度视觉分类)上的评估表明,QVix显著优于现有方法,凸显了其在弥合复杂视觉数据与LVLM探索能力之间差距方面的有效性。

关键词

引用

@article{arxiv.2312.01598,
  title  = {Good Questions Help Zero-Shot Image Reasoning},
  author = {Kaiwen Yang and Tao Shen and Xinmei Tian and Xiubo Geng and Chongyang Tao and Dacheng Tao and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2312.01598},
  year   = {2023}
}