中文

OccSTeP:4D 占据时空持久性基准测试

计算机视觉与模式识别 2025-12-18 v1

摘要

自动驾驶需要对 3D 场景具备持续的、鲁棒于时间扰动并能考虑潜在未来行为的理解。我们提出 4D 占据时空持久性(OccSTeP)这一新概念,旨在解决两个任务:(1) 反应式预测——"接下来会发生什么"以及 (2) 主动式预测——"给定特定未来行为会发生什么"。我们首次创建了 OccSTeP 基准,包含具有挑战性的场景(如错误的语义标签和丢帧)。为解决该任务,我们提出 OccSTeP-WM,一个无分词器的世界模型,维护稠密的体素场景状态并随时间增量融合时空上下文。OccSTeP-WM 采用线性复杂度注意力骨干和循环状态空间模块来捕获长程空间依赖,同时通过自运动补偿持续更新场景记忆。该设计支持在线推理,并在历史传感器输入缺失或含噪时保持鲁棒性能。大量实验证明了 OccSTeP 概念及 OccSTeP-WM 的有效性,实现了平均语义 mIoU 23.70%(+6.56% 提升)和占据 IoU 35.89%(+9.26% 提升)。数据和代码将在 https://github.com/FaterYU/OccSTeP 开源。

关键词

引用

@article{arxiv.2512.15621,
  title  = {OccSTeP: Benchmarking 4D Occupancy Spatio-Temporal Persistence},
  author = {Yu Zheng and Jie Hu and Kailun Yang and Jiaming Zhang},
  journal= {arXiv preprint arXiv:2512.15621},
  year   = {2025}
}

备注

16 pages, 5 figures