In-Context Brush:基于上下文感知潜在空间操控的零样本定制主体插入
计算机视觉与模式识别
2025-05-27 v1 人工智能
图形学
摘要
扩散模型的最新进展增强了多模态引导的视觉生成,使得定制主体插入成为可能,即根据文本提示将用户指定的物体无缝“刷”入给定图像中。然而,现有方法通常难以以高保真度插入定制主体,并通过文本提示使结果与用户意图对齐。在这项工作中,我们提出了“In-Context Brush”,这是一个通过在上下文学习范式内重新表述任务来实现定制主体插入的零样本框架。在不失一般性的前提下,我们将物体图像和文本提示表述为跨模态示例,并将带有掩码区域的目标图像作为查询。目标是在不进行模型微调的情况下,用与文本提示对齐的主体对目标图像进行修复。基于预训练的 MMDiT 修复网络,我们通过双层潜在空间操控进行测试时增强:在每个注意力头内部的头内“潜在特征偏移”,动态地偏移注意力输出以反映所需的主体语义;以及跨不同头部的头间“注意力重加权”,通过差异化注意力优先级放大提示可控性。广泛的实验和应用表明,与现有的 SOTA 方法相比,我们的方法实现了更优的身份保留、文本对齐和图像质量,且无需专门的训练或额外的数据收集。
引用
@article{arxiv.2505.20271,
title = {In-Context Brush: Zero-shot Customized Subject Insertion with Context-Aware Latent Space Manipulation},
author = {Yu Xu and Fan Tang and You Wu and Lin Gao and Oliver Deussen and Hongbin Yan and Jintao Li and Juan Cao and Tong-Yee Lee},
journal= {arXiv preprint arXiv:2505.20271},
year = {2025}
}