中文

FlowFormer++:用于光流估计预训练的掩码代价体自编码

计算机视觉与模式识别 2023-03-03 v1

摘要

FlowFormer 将 transformer 架构引入光流估计并取得了最先进的性能。FlowFormer 的核心组件是基于 transformer 的代价体编码器。受近期掩码自编码(MAE)预训练在释放 transformer 编码视觉表示能力方面成功的启发,我们提出掩码代价体自编码(MCVA),通过以新颖的 MAE 方案预训练代价体编码器来增强 FlowFormer。首先,我们引入块共享掩码策略以防止掩码信息泄漏,因为相邻源像素的代价图高度相关。其次,我们提出一种新颖的预文本重建任务,其鼓励代价体编码器聚合长距离信息并确保预训练-微调一致性。我们还展示了如何修改 FlowFormer 架构以在预训练期间适应掩码。经 MCVA 预训练后,FlowFormer++ 在 Sintel 与 KITTI-2015 基准上均位列已发表方法第一。具体而言,FlowFormer++ 在 Sintel 基准的 clean 与 final pass 上分别取得 1.07 与 1.94 的平均端点误差(AEPE),相较 FlowFormer 带来 7.76% 与 7.18% 的误差降低。FlowFormer++ 在 KITTI-2015 测试集上获得 4.52 的 F1-all,较 FlowFormer 提升 0.16。

关键词

引用

@article{arxiv.2303.01237,
  title  = {FlowFormer++: Masked Cost Volume Autoencoding for Pretraining Optical Flow Estimation},
  author = {Xiaoyu Shi and Zhaoyang Huang and Dasong Li and Manyuan Zhang and Ka Chun Cheung and Simon See and Hongwei Qin and Jifeng Dai and Hongsheng Li},
  journal= {arXiv preprint arXiv:2303.01237},
  year   = {2023}
}