中文

DOCTR:面向点云场景理解的解耦式以对象为中心的Transformer

计算机视觉与模式识别 2024-03-26 v1 人工智能

摘要

点云场景理解是一项具有挑战性的任务,旨在处理真实世界的场景点云,同时分割每个物体、估计其姿态并重建其网格。当前最先进的方法首先分割每个物体,然后通过多个阶段独立处理它们以完成不同的子任务。这导致了复杂的优化流程,并难以利用多个物体之间的关系约束。在这项工作中,我们提出了一种新颖的解耦式以对象为中心的Transformer(DOCTR),它探索以对象为中心的表示,以统一的方式促进多个物体在多个子任务上的学习。每个物体被表示为一个查询,并采用Transformer解码器迭代优化所有涉及它们关系的查询。特别是,我们引入了一种语义-几何解耦查询(SGDQ)设计,使查询特征能够分别关注与相应子任务相关的语义信息和几何信息。采用混合二分匹配模块,以在训练期间充分利用所有子任务的监督信号。定性和定量实验结果表明,我们的方法在具有挑战性的ScanNet数据集上达到了最先进的性能。代码可在https://github.com/SAITPublic/DOCTR获取。

关键词

引用

@article{arxiv.2403.16431,
  title  = {DOCTR: Disentangled Object-Centric Transformer for Point Scene Understanding},
  author = {Xiaoxuan Yu and Hao Wang and Weiming Li and Qiang Wang and Soonyong Cho and Younghun Sung},
  journal= {arXiv preprint arXiv:2403.16431},
  year   = {2024}
}