Rel3D:一种用于三维空间关系定位的最小对比基准
计算机视觉与模式识别
2020-12-04 v1
摘要
理解视觉输入中的空间关系(如“笔记本在桌上”)对人类与机器人均十分重要。现有数据集尚不充分,因其缺乏大规模、高质量的 3D 真值信息,而后者对学习空间关系至关重要。本文中,我们填补此空白,构建了 Rel3D:首个用于三维空间关系定位的大规模人工标注数据集。Rel3D 使得在大规模人类数据上量化 3D 信息预测空间关系的有效性成为可能。此外,我们提出最小对比数据收集——一种用于降低数据集偏差的新型众包方法。我们数据集中的 3D 场景以最小对比对形式出现:一对中的两个场景几乎相同,但某一空间关系在一个场景中成立而在另一个中不成立。我们经实证验证,最小对比样本既能诊断当前关系检测模型的问题,又能带来样本高效训练。代码与数据见 https://github.com/princeton-vl/Rel3D。
引用
@article{arxiv.2012.01634,
title = {Rel3D: A Minimally Contrastive Benchmark for Grounding Spatial Relations in 3D},
author = {Ankit Goyal and Kaiyu Yang and Dawei Yang and Jia Deng},
journal= {arXiv preprint arXiv:2012.01634},
year = {2020}
}
备注
Accepted to NeurIPS 2020