中文

利用跨注意力机制实现端到端开放词汇全景重建

计算机视觉与模式识别 2025-11-25 v2 机器人学

摘要

开放词汇全景重建提供了全面的场景理解,推动了具身机器人和照片级渲染技术的发展。本文提出 PanopticRecon++,一种通过 novel cross-attention 视角来构建全景重建的端到端方法。该视角通过注意力图来建模 3D 实例(作为查询)与场景 3D 嵌入场(作为键)之间的关系。不同于现有方法将查询和键的优化分离或忽视空间相邻性的方法,PanopticRecon++ 引入可学习的 3D 高斯作为实例查询。该表述注入 3D 空间先验,以保持邻近性同时保持端到端可优化性。此外,该查询表述通过利用来自查询渲染的实例掩码进行最优线性分配来实现跨帧 2D 开放词汇实例 ID 的对齐。我们通过将查询基于实例的分割概率与语义概率融合于 novel panoptic head 中,并由 panoptic loss 监督,以确保语义-实例分割一致性。在训练期间,实例查询 token 的数量会动态调整以匹配场景中对象的数量。PanopticRecon++ 在仿真和真实世界数据集上在 3D 和 2D 分割与重建性能方面表现出竞争力,并作为机器人仿真器的实际应用案例。我们的项目网站位于:https://yuxuan1206.github.io/panopticrecon_pp/

关键词

引用

@article{arxiv.2501.01119,
  title  = {Leverage Cross-Attention for End-to-End Open-Vocabulary Panoptic Reconstruction},
  author = {Xuan Yu and Yuxuan Xie and Yili Liu and Haojian Lu and Rong Xiong and Yiyi Liao and Yue Wang},
  journal= {arXiv preprint arXiv:2501.01119},
  year   = {2025}
}

备注

18 pages, 10 figures