探索零样本 VQA 中的问题分解
计算机视觉与模式识别
2023-10-27 v1
摘要
视觉问答(VQA)传统上被视为单步任务,每个问题付出同等的处理代价,这与自然的人类问答策略不同。我们探索一种用于 VQA 的问题分解策略以克服此局限。我们探查了近期开发的大视觉-语言模型使用人工撰写的分解并生成其自身视觉问题分解的能力,发现它们仅从演示中就能学习这两项任务。然而,我们表明朴素地应用模型撰写的分解会损害性能。我们引入一种模型驱动的选择性分解方法,用于二次猜测预测并纠正错误,并在三个领域的八个 VQA 任务上验证了其有效性,显示出一致的准确性提升,包括在医学 VQA 数据集上 >20% 的提升,并将 BLIP-2 在具有挑战性的 Winoground 任务的 VQA 重构上的零样本性能提升至随机水平之上。项目主页:https://zaidkhan.me/decomposition-0shot-vqa/
引用
@article{arxiv.2310.17050,
title = {Exploring Question Decomposition for Zero-Shot VQA},
author = {Zaid Khan and Vijay Kumar BG and Samuel Schulter and Manmohan Chandraker and Yun Fu},
journal= {arXiv preprint arXiv:2310.17050},
year = {2023}
}
备注
NeurIPS 2023 Camera Ready