2.5D 视觉关系检测
计算机视觉与模式识别
2021-04-27 v1
摘要
视觉 2.5D 感知涉及通过推理环境中相对于观测者的物体关系来理解场景的语义与几何。然而,现有视觉识别工作主要关注语义。为弥补这一差距,我们研究 2.5D 视觉关系检测(2.5VRD),其目标是联合检测物体并预测它们的相对深度和遮挡关系。与通用 VRD 不同,2.5VRD 是以自我为中心的,使用相机视点作为所有 2.5D 关系的公共参考。与深度估计不同,2.5VRD 以物体为中心且不仅关注深度。为推动该任务的进展,我们创建了一个新数据集,包含来自 11K 图像的 512K 个物体中 220k 个人工标注的 2.5D 关系。我们分析了该数据集并进行了广泛实验,包括在此任务上基准测试多个最先进的 VRD 模型。我们的结果表明,现有模型主要依赖语义线索和简单启发式来解决 2.5VRD,这激励了针对 2.5D 感知模型的进一步研究。新数据集可在 https://github.com/google-research-datasets/2.5vrd 获取。
引用
@article{arxiv.2104.12727,
title = {2.5D Visual Relationship Detection},
author = {Yu-Chuan Su and Soravit Changpinyo and Xiangning Chen and Sathish Thoppay and Cho-Jui Hsieh and Lior Shapira and Radu Soricut and Hartwig Adam and Matthew Brown and Ming-Hsuan Yang and Boqing Gong},
journal= {arXiv preprint arXiv:2104.12727},
year = {2021}
}