OccRWKV:基于线性复杂度的高效3D语义占据预测
计算机视觉与模式识别
2025-02-18 v3 机器人学
摘要
3D语义占据预测网络在重建3D场景的几何与语义结构方面展现了卓越的能力,为机器人导航和自动驾驶系统提供关键信息。然而,由于稠密网络结构设计带来的巨大计算开销,现有方法在准确性与延迟之间面临平衡挑战。本文引入 OccRWKV,这一受 Receptance Weighted Key Value (RWKV) 启发的高效语义占据网络。OccRWKV 将语义、占据预测与特征融合划分为独立分支,每个分支均包含 Sem-RWKV 与 Geo-RWKV 块。这些块设计用于捕获长程依赖,使网络能够学习领域特定的表征(即语义与几何),从而提升预测精度。基于现实3D占据稀疏的特性,我们将特征投影到鸟瞰视角 (BEV) 空间,提出 BEV-RWKV 块实现高效特征增强与融合。这使得在不牺牲性能的前提下实现22.2 FPS 的实时推理。实验表明,OccRWKV 在 SemanticKITTI 数据集上超越了当前最先进的方法,实现 mIoU 为 25.1,且速度比最佳基线 Co-Occ 快20倍,适合在机器人上部署以提升自动导航效率。代码与视频已在项目页面提供:https://jmwang0117.github.io/OccRWKV/。
引用
@article{arxiv.2409.19987,
title = {OccRWKV: Rethinking Efficient 3D Semantic Occupancy Prediction with Linear Complexity},
author = {Junming Wang and Wei Yin and Xiaoxiao Long and Xingyu Zhang and Zebin Xing and Xiaoyang Guo and Qian Zhang},
journal= {arXiv preprint arXiv:2409.19987},
year = {2025}
}
备注
ICRA 2025