FlowFormer:一种 Transformer 架构及其用于光流估计的掩码代价体自编码
计算机视觉与模式识别
2023-06-12 v1
摘要
本文介绍了一种基于 transformer 的新型网络架构 FlowFormer,以及用于预训练该架构以解决光流估计问题的掩码代价体自编码(MCVA)。FlowFormer 对由源—目标图像对构建的 4D 代价体进行 token 化,并通过代价体编码器—解码器架构迭代地优化光流估计。代价体编码器在潜空间中使用交替组 transformer(AGT)层导出具有代价记忆,解码器利用动态位置代价查询从代价记忆中循环解码光流。在 Sintel 基准上,FlowFormer 架构在 clean 和 final pass 上分别取得 1.16 和 2.09 的平均端点误差(AEPE),较 GMA(1.388 和 2.47)降低了 16.5% 和 15.5% 的误差。MCVA 通过以掩码自编码方案预训练代价体编码器来增强 FlowFormer,进一步释放了 FlowFormer 利用无标签数据的能力。这在光流估计中尤为关键,因为获取真实光流比在其他视觉任务中获取标签更昂贵。MCVA 全方位提升了 FlowFormer,且 FlowFormer+MCVA 在 Sintel 和 KITTI-2015 基准的所有已发表方法中均排名第 1,并取得了最佳的泛化性能。具体而言,FlowFormer+MCVA 在 Sintel 基准上取得 1.07 和 1.94 的 AEPE,较 FlowFormer 进一步降低 7.76% 和 7.18% 的误差。
引用
@article{arxiv.2306.05442,
title = {FlowFormer: A Transformer Architecture and Its Masked Cost Volume Autoencoding for Optical Flow},
author = {Zhaoyang Huang and Xiaoyu Shi and Chao Zhang and Qiang Wang and Yijin Li and Hongwei Qin and Jifeng Dai and Xiaogang Wang and Hongsheng Li},
journal= {arXiv preprint arXiv:2306.05442},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2203.16194, arXiv:2303.01237