FLODCAST:基于多模态循环架构的光流与深度预测
计算机视觉与模式识别
2023-11-01 v1
摘要
预测物体的运动与空间位置具有根本重要性,尤其在自动驾驶等安全关键场景中。本工作中,我们通过预测携带互补信息的两种不同模态——即光流与深度——来解决该问题。为此,我们提出 FLODCAST,一种光流与深度预测模型,它利用多任务循环架构,经训练可一次性联合预测两种模态。我们强调使用光流与深度图共同训练的重要性,证明当模型获知另一模态时两项任务均得以改善。我们将所提模型训练为还能预测未来若干时间步,这提供了更好的监督并带来更精确的预测,同时保留模型以自回归方式对任意未来时间范围产生输出的能力。我们在具挑战性的 Cityscapes 数据集上测试模型,在光流与深度预测上均取得最先进(state of the art)结果。得益于所生成光流的高质量,我们亦报告了在下游分割预测任务中,将我们的预测注入基于光流的掩码扭曲框架所带来的益处。
引用
@article{arxiv.2310.20593,
title = {FLODCAST: Flow and Depth Forecasting via Multimodal Recurrent Architectures},
author = {Andrea Ciamarra and Federico Becattini and Lorenzo Seidenari and Alberto Del Bimbo},
journal= {arXiv preprint arXiv:2310.20593},
year = {2023}
}
备注
Submitted to Pattern Recognition