基于格检索的视觉接地视觉问答
计算机视觉与模式识别
2022-11-16 v1 人工智能
计算与语言
人机交互
机器学习
摘要
视觉问答(VQA)系统中的视觉接地(VG)描述了一个系统将问题及其答案关联到相关图像区域的能力强弱。具有强VG的系统被认为直观上可解释,并体现出改进的场景理解。尽管近年来VQA准确率性能取得了令人印象深刻的提升,但在追求整体准确率提升的过程中,对VG性能及其评估的明确改进常常被置于次要地位。其根源在于VQA系统主流的学习范式选择,即在预定答案选项集合上训练一个判别分类器。在本工作中,我们打破分类这一主导的VQA建模范式,从信息检索任务的角度研究VQA。因此,所开发的系统直接将VG整合到其核心搜索过程中。我们的系统在一个加权有向无环图(亦称“格”)上运行,该图由给定图像的场景图结合从问题中提取的指代区域表达式导出。我们给出了方法的详细分析,并讨论其独特性质与局限。我们的方法在受考察的系统中取得了最强的VG性能,并在多种场景下展现出卓越的泛化能力。
引用
@article{arxiv.2211.08086,
title = {Visually Grounded VQA by Lattice-based Retrieval},
author = {Daniel Reich and Felix Putze and Tanja Schultz},
journal= {arXiv preprint arXiv:2211.08086},
year = {2022}
}