Panoptic-FlashOcc:一种高效基准方法,用于语义占据与全景实例中心的融合
计算机视觉与模式识别
2024-10-25 v2
摘要
全景占据提出了一个新挑战,旨在在统一框架内整合实例占据和语义占据。然而,目前仍缺乏高效的全景占据解决方案。本文提出了 Panoptic-FlashOcc,一种简单而稳健的 2D 特征框架,实现了实时全景占据。基于 FlashOcc 的轻量级设计,我们的方法在单个网络中同时学习语义占据和基于类的实例聚类,这些输出通过全景占据处理融合实现全景占据。这一方法有效解决了三维体素级表示的高内存和计算需求问题。凭借其简洁高效的设计便于部署,Panoptic-FlashOcc 在全景占据预测方面取得了显著成绩。在 Occ3D-nuScenes 数据集上,它实现了 38.5 RayIoU 和 29.1 mIoU 的语义占据性能,推理速度达到 43.9 FPS。此外,它还实现了 16.0 RayPQ 的全景占据得分,推理速度达到 30.2 FPS。这些结果在速度和准确性方面均优于现有方法。源码和训练好的模型可在以下 github 仓库找到:https://github.com/Yzichen/FlashOCC
引用
@article{arxiv.2406.10527,
title = {Panoptic-FlashOcc: An Efficient Baseline to Marry Semantic Occupancy with Panoptic via Instance Center},
author = {Zichen Yu and Changyong Shu and Qianpu Sun and Yifan Bian and Xiaobao Wei and Jiangyong Yu and Zongdai Liu and Dawei Yang and Hui Li and Yan Chen},
journal= {arXiv preprint arXiv:2406.10527},
year = {2024}
}