中文

FLODCAST:基于多模态循环架构的光流与深度预测

计算机视觉与模式识别 2023-11-01 v1

摘要

预测物体的运动与空间位置具有根本重要性,尤其在自动驾驶等安全关键场景中。本工作中,我们通过预测携带互补信息的两种不同模态——即光流与深度——来解决该问题。为此,我们提出 FLODCAST,一种光流与深度预测模型,它利用多任务循环架构,经训练可一次性联合预测两种模态。我们强调使用光流与深度图共同训练的重要性,证明当模型获知另一模态时两项任务均得以改善。我们将所提模型训练为还能预测未来若干时间步,这提供了更好的监督并带来更精确的预测,同时保留模型以自回归方式对任意未来时间范围产生输出的能力。我们在具挑战性的 Cityscapes 数据集上测试模型,在光流与深度预测上均取得最先进(state of the art)结果。得益于所生成光流的高质量,我们亦报告了在下游分割预测任务中,将我们的预测注入基于光流的掩码扭曲框架所带来的益处。

关键词

引用

@article{arxiv.2310.20593,
  title  = {FLODCAST: Flow and Depth Forecasting via Multimodal Recurrent Architectures},
  author = {Andrea Ciamarra and Federico Becattini and Lorenzo Seidenari and Alberto Del Bimbo},
  journal= {arXiv preprint arXiv:2310.20593},
  year   = {2023}
}

备注

Submitted to Pattern Recognition