SimVQA:探索用于视觉问答的模拟环境
计算机视觉与模式识别
2022-04-01 v1
摘要
现有 VQA 工作通过扰动数据集中的图像或修改已有问题与答案来探索数据增强,以实现更好的泛化。尽管这些方法表现良好,问题与答案的多样性受限于可用的图像集合。本文中,我们探索使用合成计算机生成数据来完全控制视觉与语言空间,从而提供更丰富的场景。我们量化了合成数据在真实世界 VQA 基准中的效果,以及其在何种程度上产生可泛化到真实数据的结果。通过利用 3D 与物理仿真平台,我们提供了一条生成合成数据的流水线,以扩展和替换特定类型的问题与答案,且不会暴露真实图像中可能存在的敏感或个人数据。我们给出了全面分析,同时扩展了现有的超真实数据集以用于 VQA。我们还提出了特征交换(F-SWAP)——在训练期间随机切换对象级特征,使 VQA 模型更具域不变性。我们展示了 F-SWAP 能有效增强现有真实图像 VQA 数据集,且不损害回答数据集中已有问题的准确率。
引用
@article{arxiv.2203.17219,
title = {SimVQA: Exploring Simulated Environments for Visual Question Answering},
author = {Paola Cascante-Bonilla and Hui Wu and Letao Wang and Rogerio Feris and Vicente Ordonez},
journal= {arXiv preprint arXiv:2203.17219},
year = {2022}
}
备注
Accepted to CVPR 2022. Camera-Ready version. Project page: https://simvqa.github.io/