中文

CoT3DRef:基于思维链的数据高效三维视觉定位

计算机视觉与模式识别 2024-10-08 v4

摘要

三维视觉定位是在语句条件下定位三维场景中物体的能力。大多数现有方法让指代头直接定位所指物体,导致在复杂场景中失败。此外,它未说明网络如何及为何得出最终决策。在本文中,我们探讨这一问题:能否设计一个可解释的三维视觉定位框架,有潜力模仿人类感知系统?为此,我们将三维视觉定位问题表述为序列到序列 Seq2Seq 任务,先预测一系列锚点再预测最终目标。可解释性不仅提升整体性能,还帮助我们识别失败案例。遵循思维链方法使我们能将指代任务分解为可解释的中间步骤,提升性能并使框架极具数据效率。此外,我们提出的框架可轻松集成到任何现有架构中。我们在 Nr3D、Sr3D 和 Scanrefer 基准上通过综合实验验证方法,并展示相较现有方法的一致性能增益且无需人工标注数据。进一步,我们提出的框架称为 CoT3DRef,具有显著的数据效率,在 Sr3D 数据集上仅用 10% 数据训练即匹配了全量数据训练的 SOTA 性能。代码可在 https:eslambakr.github.io/cot3dref.github.io/ 获取。

关键词

引用

@article{arxiv.2310.06214,
  title  = {CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding},
  author = {Eslam Abdelrahman and Mohamed Ayman and Mahmoud Ahmed and Habib Slim and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2310.06214},
  year   = {2024}
}

备注

ICLR 2024