BinaryVQA:一个用于评估 VQA 模型分布外泛化能力的通用测试集
计算机视觉与模式识别
2023-01-31 v1 人工智能
摘要
我们引入一个名为 BinaryVQA 的视觉问答(VQA)新测试集,以推展 VQA 模型的极限。我们的数据集包含跨 1,024 张图像的 7,800 个问题,涵盖广泛的物体、主题与概念。为便于模型评估,我们仅考虑二值问题。问题与答案经人工细致制定并核验。约 63% 的问题答案为肯定。每张图像的中位问题数与问题长度分别为 7 和 5。最先进的 OFA 模型在 BinaryVQA 数据集上达到 75% 准确率,显著低于其在 VQA v2 test-dev 数据集上的表现(94.7%)。我们还沿多个维度分析模型行为,包括:a)在不同类别(如文本、计数与注视方向)上的性能,b)模型可解释性,c)问题长度对准确率的影响,d)模型对肯定答案的偏向及引入称为 ShuffleAcc 的新分数,以及 e)对拼写与语法错误的敏感性。我们的调研展示了该数据集的难度,并表明其可在未来数年挑战 VQA 模型。数据与代码公开于:DATA and CODE。
引用
@article{arxiv.2301.12032,
title = {BinaryVQA: A Versatile Test Set to Evaluate the Out-of-Distribution Generalization of VQA Models},
author = {Ali Borji},
journal= {arXiv preprint arXiv:2301.12032},
year = {2023}
}