TP-Blend: 用于扩散模型中精确对象-风格融合的文本提示注意力配对
计算机视觉与模式识别
2026-03-03 v4 人工智能
机器学习
多媒体
摘要
当前的文本条件扩散编辑器能很好地处理单个对象替换,但在需要同时引入新对象和新风格时则表现不佳。我们提出了双提示注意力融合(TP-Blend),一个轻量级、无需训练的框架,它接收两个独立的文本提示,一个指定融合对象,另一个定义目标风格,并将两者注入到单个去噪轨迹中。TP-Blend 由两个互补的注意力处理器驱动。交叉注意力对象融合(CAOF)首先对逐头注意力进行平均,以定位对任一提示响应强烈的空间标记,然后求解一个熵正则化的最优传输问题,将完整的多头特征向量重新分配到这些位置。CAOF 在所有头的完整组合维度(例如,SD-XL 中的640维)上更新特征向量,保留了丰富的跨头相关性,同时保持低内存占用。自注意力风格融合(SASF)通过细节敏感实例归一化在每个自注意力层注入风格。一个轻量级的一维高斯滤波器分离低频和高频分量;仅将高频残差融合回去,在不破坏全局几何结构的情况下印上笔触级别的纹理。SASF 进一步将键和值矩阵与从风格提示导出的矩阵进行交换,强制执行与对象融合无关的上下文感知纹理调制。大量实验表明,TP-Blend 能产生高分辨率、照片级真实的编辑,对内容和外观都有精确控制,在定量保真度、感知质量和推理速度方面超越了最近的基线方法。
引用
@article{arxiv.2601.08011,
title = {TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models},
author = {Xin Jin and Yichuan Zhong and Yapeng Tian},
journal= {arXiv preprint arXiv:2601.08011},
year = {2026}
}