中文

ScaleFlow++:从视频中鲁棒且准确的3D运动估计

计算机视觉与模式识别 2024-10-15 v2

摘要

感知和理解3D运动是自动驾驶、机器人和运动预测等领域的核心技术。本文提出一种名为ScaleFlow++的3D运动感知方法,具有良好的可泛化性。仅需一对RGB图像,ScaleFlow++即可稳健地估计光流和运动深度(MID)。大多数现有方法直接从两个RGB帧或光流回归MID,导致结果不准确且不稳定。我们的关键洞察是跨尺度匹配,通过在不同尺度的图像对之间匹配物体来提取深层运动线索。与以往方法不同,ScaleFlow++将光流和MID估计集成到统一的架构中,基于特征匹配端到端地估计光流和MID。此外,我们还提出了全局初始化网络、全局迭代优化器和混合训练管道等模块,以整合全局运动信息、减少迭代次数并防止训练期间过拟合。在KITTI数据集上,ScaleFlow++实现了最佳的单目场景流估计性能,将SF-all从6.21降低到5.79。MID的评估甚至超越了基于RGBD的方法。此外,ScaleFlow++在刚性和非刚性场景中均实现了惊人的零样本泛化性能。代码已公开于\url{https://github.com/HanLingsgjk/CSCV}。

关键词

引用

@article{arxiv.2409.12202,
  title  = {ScaleFlow++: Robust and Accurate Estimation of 3D Motion from Video},
  author = {Han Ling and Yinghui Sun and Quansen Sun and Yuhui Zheng},
  journal= {arXiv preprint arXiv:2409.12202},
  year   = {2024}
}

备注

This is a product uploaded incorrectly. I originally intended to use it to replace ScaleRAFT (arXiv:2407.09797), but I made a mistake in the operation