中文

MxT:Mamba x Transformer 用于图像填充

计算机视觉与模式识别 2024-08-19 v3

摘要

图像填充或图像完成是计算机视觉中的关键任务,旨在用语义连贯的内容恢复图像的缺失或损坏区域。该技术需要精确地在局部纹理复制和全局上下文理解之间取得平衡,以确保恢复后的图像无缝融合到其周围环境。传统方法使用卷积神经网络(CNN)在捕获局部模式方面有效,但由于受限的感受野,往往难以处理更广泛的上下文关系。最近的进展 incorpora 了 transformer,利用其理解全局相互作用的能力。然而,这些方法面临计算效率低下且难以保持细粒度细节的问题。为克服这些挑战,我们引入了MxT,由提出的混合模块(HM)组成,该模块以协同方式将 Mamba 与 transformer 结合在一起。Mamba擅长以线性计算成本处理长序列,使其成为处理长范围数据相互作用的理想补充。我们的HM促进了像素和 patch 级别的双层交互学习,大大增强了模型在重建高质量和上下文准确性方面的能力。我们在广泛使用的CelebA-HQ和Places2-standard数据集上评估了MxT,其中它持续超过现有最先进的方法。代码将公开:https://github.com/ChrisChen1023/MxT。

关键词

引用

@article{arxiv.2407.16126,
  title  = {MxT: Mamba x Transformer for Image Inpainting},
  author = {Shuang Chen and Amir Atapour-Abarghouei and Haozheng Zhang and Hubert P. H. Shum},
  journal= {arXiv preprint arXiv:2407.16126},
  year   = {2024}
}