中文

VQA-Levels:面向 VQA 系统分类提问的层次化方法

计算机视觉与模式识别 2025-02-06 v1 人工智能 机器学习

摘要

设计用于视觉问答(VQA)的数据集是一个困难且复杂的任务,需要运用自然语言处理进行解析,以及计算机视觉来分析回答问题所需的图像相关方面。尽管研究人员已开发出多个基准数据集,但使用它们进行系统性性能测试仍存在诸多问题。本文提出了新的基准数据集——现已就绪的试点版本称为 VQA-Levels,用于系统性地测试 VQA 系统,并帮助研究人员推进该领域的发展。数据集中的问题被分类为七个等级, ranging 从基于低级图像特征的直接答案(甚至无需分类器)到需要对整个图像内容进行高级抽象的问题。数据集中的问题 exhibits 一个或多个十个属性中的一个或多个属性。每个问题被划分为 1 到 7 的特定等级。1-3 级直接基于视觉内容,而其余等级需要关于图像中对象的额外知识。每个问题通常只有一个或两个单词的答案。这些问题是“自然的”,即在看到图像时,人类很可能提出此类问题。以 Level 1 的示例问题为例:“图像中红色区域的形状是什么?”,而 Level 7 的示例问题则是:“为何要切纸?”对现有 VQA 系统进行初始测试显示,其在 Level 1(低级特征)和 Level 2(对象分类)问题上的成功率最高,Level 3(场景文本)次之,随后是 Level 6(外推)和 Level 7(整体场景分析)问题。本文的工作将大幅度地帮助系统性地分析 VQA 系统。

关键词

引用

@article{arxiv.2502.02951,
  title  = {VQA-Levels: A Hierarchical Approach for Classifying Questions in VQA},
  author = {Madhuri Latha Madaka and Chakravarthy Bhagvati},
  journal= {arXiv preprint arXiv:2502.02951},
  year   = {2025}
}