环视与指代:用于三维视觉定位的二维合成语义知识蒸馏
计算机视觉与模式识别
2022-11-28 v1
摘要
三维视觉定位任务通过视觉与语言双流理解指称语言以在三维场景中识别目标物体。然而,现有多数方法将视觉流致力于使用现成的点云编码器捕获三维视觉线索。本文所解决的核心问题是“我们能否通过由点云合成的二维线索巩固三维视觉流,并在训练与测试中高效利用它们?”。其主要思想是借助从三维点云合成得到的丰富二维物体表征来辅助三维编码器,而无需额外二维输入。为此,我们利用由三维点云合成生成的二维线索,并通过实验证实其提升所学视觉表征质量的适用性。我们在 Nr3D、Sr3D 与 ScanRefer 数据集上通过综合实验验证了方法,并显示出相较现有方法的一致性能增益。我们提出的模块称为 Look Around and Refer (LAR),在 Nr3D、Sr3D 与 ScanRefer 三个基准上显著优于最先进的三维视觉定位技术。代码见 https://eslambakr.github.io/LAR.github.io/。
引用
@article{arxiv.2211.14241,
title = {Look Around and Refer: 2D Synthetic Semantics Knowledge Distillation for 3D Visual Grounding},
author = {Eslam Mohamed Bakr and Yasmeen Alsaedy and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2211.14241},
year = {2022}
}