中文

ScaleFlow++: 从视频中鲁棒且准确的估计3D运动

计算机视觉与模式识别 2024-10-17 v2

摘要

感知和理解3D运动是自动驾驶、机器人和运动预测等领域的核心技术。本文提出了一种易于泛化的3D运动感知方法,称为ScaleFlow++。仅凭一对RGB图像,ScaleFlow++就能稳健地估计光流和运动深度(MID)。大多数现有方法直接从两个RGB帧或光流回归MID,导致结果不准确且不稳定。我们的关键洞察是跨尺度匹配,这通过在不同尺度的图像对之间匹配对象来提取深层运动线索。与以前的方法不同,ScaleFlow++将光流和MID估计集成到一个统一的架构中,基于特征匹配端到端地估计光流和MID。此外,我们还提出了全局初始化网络、全局迭代优化器和混合训练管道等模块,以整合全局运动信息、减少迭代次数并防止训练期间过拟合。在KITTI数据集上,ScaleFlow++实现了最佳的单目场景流估计性能,将SF-all从6.21降低到5.79。MID的评估甚至超过了基于RGBD的方法。此外,ScaleFlow++在刚性和非刚性场景中均实现了惊人的零样本泛化性能。代码可在\url{https://github.com/HanLingsgjk/CSCV}获取。

关键词

引用

@article{arxiv.2407.09797,
  title  = {ScaleFlow++: Robust and Accurate Estimation of 3D Motion from Video},
  author = {Han Ling and Quansen Sun},
  journal= {arXiv preprint arXiv:2407.09797},
  year   = {2024}
}

备注

14 pages; Previously this version appeared as arXiv:2409.12202 which was submitted as a new work by accident