野生环境中的零样本单目场景流估计
计算机视觉与模式识别
2025-01-22 v2
摘要
大型模型在许多低层视觉任务中表现出越来越好的跨数据集泛化能力,如深度估计,但目前尚不存在针对场景流的通用模型。尽管场景流具有广泛的潜在应用价值,但因当前预测模型泛化能力差,尚未在实际中得到广泛使用。我们识别出三个关键挑战并为每一挑战提出了解决方案。首先,我们创建了一种联合几何和运动估计的方法,以实现精确预测。其次,我们通过一种数据配方来缓解场景流数据稀缺问题,为我们提供了100万个跨越多样合成场景的标注训练样本。最后,我们评估了场景流预测的不同参数化方式,采用一种自然且有效的参数化方式。我们的 resulting model 在3D端点误差方面超越了现有方法以及基于大规模模型构建的基线,并显示出对来自DAVIS和RoboTAP的随意捕获视频以及机器人操控场景的零样本泛化。总体而言,我们的方法使场景流预测在野生环境中更加实用。
引用
@article{arxiv.2501.10357,
title = {Zero-Shot Monocular Scene Flow Estimation in the Wild},
author = {Yiqing Liang and Abhishek Badki and Hang Su and James Tompkin and Orazio Gallo},
journal= {arXiv preprint arXiv:2501.10357},
year = {2025}
}
备注
Project Website: https://research.nvidia.com/labs/lpr/zero_msf//