通过全局运动聚合学习估计隐藏运动
计算机视觉与模式识别
2021-08-02 v3
摘要
遮挡对依赖局部证据的光流算法构成重大挑战。我们将遮挡点视为在第一帧成像但在下一帧未成像的点,这略微重载了标准定义,因为它也包括移出帧外的点。估计这些点的运动极其困难,尤其在两帧设定下。先前工作依赖 CNN 学习遮挡,成效不大,或需要多帧利用时间平滑性推理遮挡。在本文中,我们认为遮挡问题在两帧情形下可通过建模图像自相似性更好地解决。我们引入全局运动聚合模块,一种基于 transformer 的方法来发现第一图像中像素间的长程依赖,并对相应运动特征执行全局聚合。我们证明遮挡区域的光流估计可显著改善而不损害非遮挡区域的性能。该方法在具挑战性的 Sintel 数据集上取得新的 SOTA 结果,在 Sintel Final 上平均端点误差改善 13.6%,在 Sintel Clean 上改善 13.7%。在提交时,我们的方法在所有已发表与未发表方法中排名这些基准第一。代码见 https://github.com/zacjiang/GMA
关键词
引用
@article{arxiv.2104.02409,
title = {Learning to Estimate Hidden Motions with Global Motion Aggregation},
author = {Shihao Jiang and Dylan Campbell and Yao Lu and Hongdong Li and Richard Hartley},
journal= {arXiv preprint arXiv:2104.02409},
year = {2021}
}
备注
Accepted to ICCV 2021