SIR:通过不同镜头观看同一场景的自监督图像校正
计算机视觉与模式识别
2021-06-21 v2 图像与视频处理
摘要
深度学习已凭借基于大规模合成数据集的监督训练利用深度神经网络的表征能力,在图像校正中展现出威力。然而,由于特定畸变模型的有限通用性以及缺乏对畸变与校正过程的显式建模,该模型可能对合成图像过拟合,且在真实世界鱼眼图像上泛化不佳。本文提出一种新颖的自监督图像校正(SIR)方法,其基于一个重要洞见:来自不同镜头的同一场景畸变图像的校正结果应当一致。具体地,我们设计了一种带共享编码器和多个预测头的新型网络架构,每个预测头预测一种特定畸变模型的畸变参数。我们进一步利用可微扭曲模块从畸变参数生成校正图像与再畸变图像,并在训练中利用它们之间的模型内与模型间一致性,从而形成无需真实畸变参数或正常图像的自监督学习方案。在合成数据集与真实世界鱼眼图像上的实验表明,我们的方法取得了与监督基线方法及代表性最先进(SOTA)方法相当甚至更优的性能。自监督学习还在保持畸变模型自一致性的同时提升了其通用性。
引用
@article{arxiv.2011.14611,
title = {SIR: Self-supervised Image Rectification via Seeing the Same Scene from Multiple Different Lenses},
author = {Jinlong Fan and Jing Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2011.14611},
year = {2021}
}