基于 Transformer 的低信息损失多样化图像补全
计算机视觉与模式识别
2024-04-16 v3
摘要
近期,基于 Transformer 的方法在图像修复中取得了巨大成功。然而,我们发现这些解决方案将每个像素视为一个 token,从而在两个方面遭受信息损失问题:1)为了效率考虑,它们将输入图像下采样至低得多的分辨率。2)它们将 个 RGB 值量化为少量(例如 512 个)量化颜色值。量化像素的索引被用作 Transformer 输入和预测目标的 token。为了缓解这些问题,我们提出了一种名为“PUT”的基于 Transformer 的新框架。具体而言,为了避免输入下采样同时保持计算效率,我们设计了一个基于块的自编码器 P-VQVAE。编码器将掩码图像转换为不重叠的块 token,解码器从修复后的 token 中恢复掩码区域,同时保持未掩码区域不变。为了消除输入量化造成的信息损失,应用了非量化 Transformer。它直接将 P-VQVAE 编码器的特征作为输入而无需任何量化,并仅将量化 token 作为预测目标。此外,为了使修复过程更具可控性,我们引入了语义和结构条件作为额外指导。大量实验表明,我们的方法在图像保真度上大大优于现有的基于 Transformer 的方法,并且在复杂的大规模数据集(例如 ImageNet)上,比最先进的多样化图像修复方法实现了更高的多样性和更好的保真度。代码可在 https://github.com/liuqk3/PUT 获取。
引用
@article{arxiv.2404.00513,
title = {Transformer based Pluralistic Image Completion with Reduced Information Loss},
author = {Qiankun Liu and Yuqi Jiang and Zhentao Tan and Dongdong Chen and Ying Fu and Qi Chu and Gang Hua and Nenghai Yu},
journal= {arXiv preprint arXiv:2404.00513},
year = {2024}
}
备注
Accepted by TPAMI (2024). arXiv admin note: text overlap with arXiv:2205.05076