利用先验特征与注意力增强的学习型图像修复
计算机视觉与模式识别
2023-08-29 v2
摘要
许多近期修复工作通过利用深度神经网络(DNNs)建模各类先验信息以进行图像复原,取得了令人印象深刻的成果。遗憾的是,这些方法性能很大程度上受限于普通卷积神经网络(CNNs)骨干的表征能力。另一方面,经自监督预训练的Vision Transformers(ViT)在许多视觉识别与目标检测任务中展现出巨大潜力。一个自然的问题是:修复任务能否从ViT骨干中大幅受益?然而,直接在修复网络中替换新骨干并非易事,因为修复本质上不同于识别任务,是一个逆问题。为此,本文将基于预训练的Masked AutoEncoder(MAE)引入修复模型,利用其更丰富的信息化先验增强修复过程。此外,我们提出利用来自MAE的注意力先验,使修复模型学习被掩码与未掩码区域间更长远距离的依赖关系。本文就修复与自监督预训练模型进行了充分的消融讨论。此外,在Places2与FFHQ上的实验证明了我们所提模型的有效性。代码与预训练模型发布于https://github.com/ewrfcas/MAE-FAR。
引用
@article{arxiv.2208.01837,
title = {Learning Prior Feature and Attention Enhanced Image Inpainting},
author = {Chenjie Cao and Qiaole Dong and Yanwei Fu},
journal= {arXiv preprint arXiv:2208.01837},
year = {2023}
}
备注
ECCV 2022