面向可解释的 3D 接地视觉问答:新基准与强基线
计算机视觉与模式识别
2022-09-27 v1
摘要
近来,3D 视觉-语言任务吸引了日益增长的研究兴趣。相较于其他视觉-语言任务,3D 视觉问答(VQA)任务研究较少,且更易受语言先验与指代歧义影响。同时,若干近期提出的 3D VQA 数据集因规模与标注方式限制,不能很好地支撑该任务。本文正式定义并解决一项 3D 接地 VQA 任务,通过收集名为 FE-3DGQA 的新 3D VQA 数据集,其含多样且相对自由形式的问答对,以及密集且完全接地的边界框标注。为获得更具可解释性的答案,我们将复杂问答对中出现的物体按不同语义类型标注,包括答案接地物体(问题中出现与未出现者)及答案接地物体的上下文物体。我们还提出一种新的 3D VQA 框架,以有效预测完全视觉接地且可解释的答案。大量实验验证,我们新收集的基准数据集可从不同方面有效评估各类 3D VQA 方法,且新提框架在新基准上达到了 SOTA 性能。新数据集与代码将公开于 http://github.com/zlccccc/3DGQA。
引用
@article{arxiv.2209.12028,
title = {Towards Explainable 3D Grounded Visual Question Answering: A New Benchmark and Strong Baseline},
author = {Lichen Zhao and Daigang Cai and Jing Zhang and Lu Sheng and Dong Xu and Rui Zheng and Yinjie Zhao and Lipeng Wang and Xibo Fan},
journal= {arXiv preprint arXiv:2209.12028},
year = {2022}
}
备注
13 pages, 10 figures