中文

Floxels: 基于体素的快速无监督场景流估计

计算机视觉与模式识别 2025-04-07 v2 机器学习 机器人学

摘要

场景流估计是许多机器人应用的基础任务,包括鲁棒的动态物体检测、自动标注和传感器同步。两种针对该问题的方法类型已发展完善:1)监督方法 2)基于优化的方法。监督方法在推理期间快速且 achieves 高质�结果,但受限于需要大量标记训练数据的需求,并且对域间差异较敏感。相比之下,无监督的测试时优化方法不面临域间差异问题,但通常在运行时方面存在显著延迟,出现伪影,或难以收敛到正确解。本文缓解了现有基于优化方法的若干局限性。为此,我们 1)引入一种简单的基于体素网格的模型,相较于标准的 MLP-based 表述在多个维度上均有所改进; 2)引入一种新的多帧损失表述。 3)我们将两者结合在我们新方法中,称为 Floxels。在 Argoverse 2 基准测试中,Floxels 仅次于 EulerFlow 等无监督方法,同时以可观的性能实现了可观的计算效率。Floxels 相对于 EulerFlow 实现了约 60-140 倍的显著加速,将运行时间从每序列的 1 天缩短至 10 分钟。相对于更快但质量较低的基线 NSFP,Floxels 实现了约 14 倍的加速。

关键词

引用

@article{arxiv.2503.04718,
  title  = {Floxels: Fast Unsupervised Voxel Based Scene Flow Estimation},
  author = {David T. Hoffmann and Syed Haseeb Raza and Hanqiu Jiang and Denis Tananaev and Steffen Klingenhoefer and Martin Meinke},
  journal= {arXiv preprint arXiv:2503.04718},
  year   = {2025}
}

备注

Accepted at CVPR 2025