中文

CRAFT:用于鲁棒光流估计的交叉注意力流Transformer

计算机视觉与模式识别 2022-04-01 v1

摘要

光流估计旨在通过识别两幅图像间的对应像素来求得2D运动场。尽管基于深度学习的光流方法取得了巨大进展,准确估计带有运动模糊的大位移仍具挑战性。这主要是因为作为像素匹配基础的相关体,是作为两幅图像卷积特征的点积计算的。卷积特征的局部性使得计算出的相关性易受各种噪声影响。在带有运动模糊的大位移情况下,噪声相关性会导致估计光流中的严重误差。为克服该挑战,我们提出了一种新架构“交叉注意力流Transformer”(CRAFT),旨在重振相关体计算。在CRAFT中,一个语义平滑Transformer层对一帧的特征进行变换,使其更具全局性和语义稳定性。此外,点积相关性被Transformer跨帧注意力所取代。该层通过Query和Key投影滤除特征噪声,并计算出更准确的相关性。在Sintel(Final)和KITTI(前景)基准上,CRAFT取得了新的最先进性能。此外,为测试不同模型在大运动下的鲁棒性,我们设计了一种图像平移攻击,将输入图像平移以生成大的人工运动。在此攻击下,CRAFT比两种代表性方法RAFT和GMA表现得更鲁棒。CRAFT的代码可在 https://github.com/askerlee/craft 获取。

关键词

引用

@article{arxiv.2203.16896,
  title  = {CRAFT: Cross-Attentional Flow Transformer for Robust Optical Flow},
  author = {Xiuchao Sui and Shaohua Li and Xue Geng and Yan Wu and Xinxing Xu and Yong Liu and Rick Goh and Hongyuan Zhu},
  journal= {arXiv preprint arXiv:2203.16896},
  year   = {2022}
}

备注

CVPR 2022 camera ready