中文

A$^\text{T}$A:面向文本引导的主体位置可变背景填充的自适应变换代理

计算机视觉与模式识别 2025-04-03 v1

摘要

图像填充旨在填充图像的缺失区域。最近,越来越多关注前景条件背景填充—a类在提供主体及其关联文本提示的情况下填充图像背景的子任务。现有的背景填充方法通常严格保留主体在源图像中的原始位置,导致主体与生成背景之间不一致。为解决这一挑战,我们提出了新任务,即“文本引导的主体位置可变背景填充”,旨在动态调整主体位置以实现主体与填充背景之间的和谐关系,并提出了用于该任务的自适应变换代理(AT^\text{T}A)。首先,我们设计了 PosAgent 模块,基于给定特征自适应预测合适的位移以实现可变主体位置。其次,我们设计了逆位移变换(RDT)模块,将多个 PosAgent 模块以逆结构排列,以基于语义信息将深层到浅层的特征图进行变换。最后,我们为 AT^\text{T}A 配备了位置开关嵌入,以控制生成图像中主体位置是自适应预测还是固定。广泛的比较实验验证了 AT^\text{T}A 方法的有效性,该方法不仅在主体位置可变填充中显示出优越的填充能力,而且在主体位置固定填充中也能确保良好性能。

关键词

引用

@article{arxiv.2504.01603,
  title  = {A$^\text{T}$A: Adaptive Transformation Agent for Text-Guided Subject-Position Variable Background Inpainting},
  author = {Yizhe Tang and Zhimin Sun and Yuzhen Du and Ran Yi and Guangben Lu and Teng Hu and Luying Li and Lizhuang Ma and Fangyuan Zou},
  journal= {arXiv preprint arXiv:2504.01603},
  year   = {2025}
}

备注

Accepted by CVPR 2025