基于解耦几何与时序建模的层次上下文对齐语义占据预测
计算机视觉与模式识别
2026-01-01 v2
摘要
基于摄像机的三维语义占据预测(SOP)是从有限的二维图像观察中理解复杂三维场景的关键技术。现有SOP方法通常聚合上下文特征以辅助占据表示学习,缓解遮挡或歧义问题。然而,这些解决方案在聚合过程中常存在位置在不同帧中对应特征具有不同语义含义的对齐问题,导致不可靠的上下文融合结果和不稳定的表示学习过程。为此,我们引入一种新的层次上下文对齐范式以实现更准确的SOP(Hi-SOP)。Hi-SOP首先对几何和时序上下文进行解耦分别进行对齐,这两个分支随后组合以增强SOP的可靠性。这种将视觉输入解析为局部-全局对齐层次结构包括:(I)解耦的几何和时序独立对齐,分别利用深度置信度和相机位姿作为先验进行相关特征匹配;(II)基于语义一致性进行全局对齐和几何体积与时序体积的组合。我们的方法在SemanticKITTI与NuScenes-Occupancy数据集上优于SOTA,在NuScenes数据集上进行的LiDAR语义分割也表现出色。项目网站可访问 https://arlo0o.github.io/hisop.github.io/。
引用
@article{arxiv.2412.08243,
title = {Hierarchical Context Alignment with Disentangled Geometric and Temporal Modeling for Semantic Occupancy Prediction},
author = {Bohan Li and Jiajun Deng and Yasheng Sun and Xiaofeng Wang and Xin Jin and Wenjun Zeng},
journal= {arXiv preprint arXiv:2412.08243},
year = {2026}
}
备注
IEEE TPAMI 2025