迈向无监督真实视觉问答
计算机视觉与模式识别
2023-03-10 v1
摘要
本文研究真实视觉问答(RVQA)问题,即模型需拒绝不可回答问题(UQ)并回答可回答问题(AQ)。我们首先指出当前 RVQA 研究中的两个缺陷:(1)数据集含有过多缺乏挑战性的 UQ;(2)训练需要大量标注的 UQ。为解决第一个缺陷,我们提出一个新的测试数据集 RGQA,它将现有 VQA 数据集中的 AQ 与约 29K 人工标注的 UQ 相结合。这些 UQ 由基于 CLIP 和基于扰动两种途径生成,包含细粒度与粗粒度的图像-问题对。为解决第二个缺陷,我们引入一种无监督训练方法。该方法将随机配对图像与问题得到的伪 UQ,与用于生成更多细粒度伪 UQ 的 RoI Mixup 过程以及用于正则化模型置信度的模型集成相结合。实验表明,使用伪 UQ 显著优于 RVQA 基线;RoI Mixup 与模型集成进一步提升了增益。最后,人工评估揭示了人类与模型之间的性能差距,表明仍需更多 RVQA 研究。
引用
@article{arxiv.2303.05068,
title = {Toward Unsupervised Realistic Visual Question Answering},
author = {Yuwei Zhang and Chih-Hui Ho and Nuno Vasconcelos},
journal= {arXiv preprint arXiv:2303.05068},
year = {2023}
}
备注
Yuwei Zhang and Chih-Hui Ho contributed equally to this work