Super-CLEVR:用于诊断视觉推理中领域鲁棒性的虚拟基准
计算机视觉与模式识别
2023-06-02 v2 计算与语言
摘要
视觉问答(VQA)模型在分布外数据上往往表现不佳,且难以实现领域泛化。由于该任务的多模态特性,多种变异因素相互交织,使得泛化难以分析。这促使我们引入一个虚拟基准 Super-CLEVR,其中 VQA 领域偏移中的不同因素可被隔离,从而能够独立研究其影响。我们考虑了四个因素:视觉复杂度、问题冗余度、概念分布与概念组合性。借助可控生成的数据,Super-CLEVR 使我们能够在测试数据沿上述各轴之一不同于训练数据的情况下测试 VQA 方法。我们研究了四种现有方法,包括两种神经符号方法 NSCL 和 NSVQA,以及两种非符号方法 FiLM 和 mDETR;还有我们提出的方法——概率 NSVQA(P-NSVQA),它在 NSVQA 的基础上扩展了不确定性推理。P-NSVQA 在四个领域偏移因素中的三个上优于其他方法。我们的结果表明,将推理与感知解耦,并结合概率不确定性,构成了一种对领域偏移更具鲁棒性的强大 VQA 模型。数据集与代码发布于 https://github.com/Lizw14/Super-CLEVR。
引用
@article{arxiv.2212.00259,
title = {Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning},
author = {Zhuowan Li and Xingrui Wang and Elias Stengel-Eskin and Adam Kortylewski and Wufei Ma and Benjamin Van Durme and Alan Yuille},
journal= {arXiv preprint arXiv:2212.00259},
year = {2023}
}
备注
Published in CVPR 2023 as Highlight. Data and code are released at https://github.com/Lizw14/Super-CLEVR