中文

基于层次化时序上下文学习的相机语义场景完成

计算机视觉与模式识别 2024-11-07 v4

摘要

相机-based 3D 语义场景完成(SSC)对于从有限的 2D 图像观察中预测复杂的 3D 布局至关重要。现有的主流解决方案通常通过大致堆叠历史帧来利用时间信息,这种直观的时间建模不可避免地削弱了有效线索并增加了学习难度。为此,我们提出了 HTCR(Hierarchical Temporal Context Learning),一种用于改进相机-based 语义场景完成的层次化时序上下文学习范式。本工作的核心创新在于将时间上下文学习分解为两个层次化步骤:(a)跨帧亲和度测量;(b)基于亲和度的动态细化。首先,为了将关键相关上下文与冗余信息分离,我们引入了带有尺度感知隔离和多个独立学习者的模式亲和度,以实现细粒度的上下文对应关系建模。随后,为了动态补偿不完整的观察,我们基于最初确定的高亲和度位置及其相邻相关区域自适应地细化特征采样位置。我们的方法在 SemanticKITTI 基准上名列第 1,而在 OpenOccupancy 基准上即超过了基于 LiDAR 的方法。我们的代码可在 https://github.com/Arlo0o/HTCL 获取。

关键词

引用

@article{arxiv.2407.02077,
  title  = {Hierarchical Temporal Context Learning for Camera-based Semantic Scene Completion},
  author = {Bohan Li and Jiajun Deng and Wenyao Zhang and Zhujin Liang and Dalong Du and Xin Jin and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2407.02077},
  year   = {2024}
}

备注

ECCV 2024