中文

CLIP-FLow:用于光流估计的半监督迭代伪标签对比学习

计算机视觉与模式识别 2022-12-06 v3

摘要

由于缺乏大量带标签的真实场景数据,合成数据集常被用于预训练端到端光流网络。但从合成场景迁移到真实场景时,准确率会出现大幅下降。我们如何更好地将合成域学到的知识迁移到真实域?为此,我们提出 CLIP-FLow,一个半监督迭代伪标签框架,用于将预训练知识迁移到目标真实域。我们利用大规模无标签真实数据,在迭代更新的伪真值标签监督下促进迁移学习,从而弥合合成域与真实域之间的领域鸿沟。此外,我们在参考特征与由伪真值光流变换后的特征上提出对比光流损失,以进一步提升准确匹配,并抑制由运动、遮挡或噪声伪标签导致的误匹配。我们采用 RAFT 作为骨干网络,获得了 4.11% 的 F1-all 误差,即相较 RAFT(5.10%)误差降低了 19%,在提交时于 KITTI 2015 基准上排名第二。我们的框架也可扩展至其他模型,例如 CRAFT,在 KITTI 2015 基准上将 F1-all 误差从 4.79% 降至 4.66%。

关键词

引用

@article{arxiv.2210.14383,
  title  = {CLIP-FLow: Contrastive Learning by semi-supervised Iterative Pseudo labeling for Optical Flow Estimation},
  author = {Zhiqi Zhang and Nitin Bansal and Changjiang Cai and Pan Ji and Qingan Yan and Xiangyu Xu and Yi Xu},
  journal= {arXiv preprint arXiv:2210.14383},
  year   = {2022}
}