HINT:具有掩码感知编码和增强注意力的高质量图像修复Transformer
计算机视觉与模式识别
2024-02-23 v1
摘要
现有的图像修复方法利用基于卷积的下采样方法减少空间维度。这可能导致从受损图像中丢失信息,因为可用信息本身就很稀疏,尤其是在大面积缺失区域的情况下。Transformer中自注意力机制的最新进展已导致包括修复在内的许多计算机视觉任务的显著改进。然而,受计算成本的限制,现有方法无法充分利用此类模型的长程建模能力。在本文中,我们提出了一种端到端的高质量图像修复Transformer,缩写为HINT,它包含一个新颖的掩码感知像素洗牌下采样模块(MPD),以保留从受损图像中提取的可见信息,同时保持模型内高层推理可用信息的完整性。此外,我们提出了空间激活通道注意力层(SCAL),这是一种高效的自注意力机制,解释空间感知以在多个尺度上对受损图像进行建模。为了进一步增强SCAL的有效性,受语音识别最新进展的启发,我们引入了一种三明治结构,在SCAL模块前后放置前馈网络。我们在四个数据集CelebA、CelebA-HQ、Places2和Dunhuang上展示了HINT与当代最先进模型相比的优越性能。
引用
@article{arxiv.2402.14185,
title = {HINT: High-quality INPainting Transformer with Mask-Aware Encoding and Enhanced Attention},
author = {Shuang Chen and Amir Atapour-Abarghouei and Hubert P. H. Shum},
journal= {arXiv preprint arXiv:2402.14185},
year = {2024}
}