中文

探索零样本 VQA 中的问题分解

计算机视觉与模式识别 2023-10-27 v1

摘要

视觉问答(VQA)传统上被视为单步任务,每个问题付出同等的处理代价,这与自然的人类问答策略不同。我们探索一种用于 VQA 的问题分解策略以克服此局限。我们探查了近期开发的大视觉-语言模型使用人工撰写的分解并生成其自身视觉问题分解的能力,发现它们仅从演示中就能学习这两项任务。然而,我们表明朴素地应用模型撰写的分解会损害性能。我们引入一种模型驱动的选择性分解方法,用于二次猜测预测并纠正错误,并在三个领域的八个 VQA 任务上验证了其有效性,显示出一致的准确性提升,包括在医学 VQA 数据集上 >20% 的提升,并将 BLIP-2 在具有挑战性的 Winoground 任务的 VQA 重构上的零样本性能提升至随机水平之上。项目主页:https://zaidkhan.me/decomposition-0shot-vqa/

关键词

引用

@article{arxiv.2310.17050,
  title  = {Exploring Question Decomposition for Zero-Shot VQA},
  author = {Zaid Khan and Vijay Kumar BG and Samuel Schulter and Manmohan Chandraker and Yun Fu},
  journal= {arXiv preprint arXiv:2310.17050},
  year   = {2023}
}

备注

NeurIPS 2023 Camera Ready