Pinco:面向前景条件图像填充的扩散 Transformer 位置诱导一致性适配器
计算机视觉与模式识别
2025-08-07 v2
摘要
前景条件图像填充旨在利用提供的前景主体和文本描述,无缝填充图像的背景区域。虽然现有的文本到图像(T2I)基于图像的填充方法可用于此任务,但会出现主体形状膨胀、畸变或难以与文本描述保持一致的问题,导致视觉元素与文本描述之间存在不一致。为此,我们提出了 Pinco,一种即插即用的前景条件图像填充适配器,能够在有效保持前景主体形状的同时,生成与文本对齐性强的高质量背景。首先,我们设计了自一致适配器(Self-Consistent Adapter),将前景主体特征整合到与布局相关的自注意力层中,从而通过确保模型在处理整体图像布局时能够有效考虑前景主体的特征,从而缓解文本与主体特征之间的冲突。其次,我们设计了解耦图像特征提取方法(Decoupled Feature Extraction),采用不同架构分别提取语义特征和空间特征,显著提高了主体特征的提取效果,确保了主体形状的高质量保持。最后,为了确保准确地利用提取的特征并将注意力集中于主体区域,我们引入了共享位置嵌入锚(Shared Positional Embedding Anchor),大大提高了模型对主体特征的理解能力,并提升了训练效率。广泛的实验表明,我们的方法在前景条件图像填充方面实现了卓越的性能和效率。
引用
@article{arxiv.2412.03812,
title = {Pinco: Position-induced Consistent Adapter for Diffusion Transformer in Foreground-conditioned Inpainting},
author = {Guangben Lu and Yuzhen Du and Zhimin Sun and Ran Yi and Yifan Qi and Yizhe Tang and Tianyi Wang and Lizhuang Ma and Fangyuan Zou},
journal= {arXiv preprint arXiv:2412.03812},
year = {2025}
}