中文

Token Painter:基于掩码自回归模型的无训练文本导向图像填充方法

计算机视觉与模式识别 2025-11-11 v2

摘要

文本导向图像填充旨在根据文本提示填充被遮盖的图像区域,同时保持背景一致。尽管扩散方法已成为主流,但其在潜在空间中对整个图像建模的特性,使得结果难以与提示细节对齐且难以保持一致的背景。为此,我们探索了掩码自回归(MAR)模型用于该任务。MAR天然支持通过生成对应掩码区域的潜在标记来实现图像填充,能够在不改变背景的前提下实现更好的局部可控性。然而,直接将MAR应用于该任务会导致填充内容要么忽略提示,要么与背景情境不协调。通过分析填充图像的注意力图,我们识别了背景标记对MAR生成过程中文本标记的影响,并据此设计了基于MAR的无训练文本导向图像填充方法——Token Painter。我们的 метод引入了两个关键组件:(1)双流编码器信息融合(DEIF),该方法在频域融合文本和背景的语义与上下文信息,以生成新的指导标记,使MAR能够生成符合文本的填充内容,同时与背景保持和谐。(2)自适应解码器注意力得分增强(ADAE),该方法自适应增强指导标记和填充标记上的注意力得分,以进一步提升提示细节的对齐程度和内容的视觉质量。大量实验表明,我们的无训练方法在几乎所有指标上均优于先前的状态方法。代码:https://github.com/longtaojiang/Token-Painter。

关键词

引用

@article{arxiv.2509.23919,
  title  = {Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models},
  author = {Longtao Jiang and Jie Huang and Mingfei Han and Lei Chen and Yongqiang Yu and Feng Zhao and Xiaojun Chang and Zhihui Li},
  journal= {arXiv preprint arXiv:2509.23919},
  year   = {2025}
}