注入关键处:基于空间自适应的无训练文本到图像个性化身份保持
计算机视觉与模式识别
2026-02-17 v1
摘要
个性化文本到图像生成旨在将特定身份整合到任意上下文中。然而,现有的无调参方法通常采用空间均匀视觉注入,导致身份特征污染非面部区域(如背景和光照),从而降低文本遵循度。为解决这一问题且无需高昂的微调,我们提出了SpatialID,一个无训练的空间自适应身份调制框架。SpatialID通过源自跨注意力响应的空间掩码提取器,根本上将身份注入分解为面部相关区域和无上下文区域。此外,我们引入了时空调度策略,该策略动态调整空间约束——从高斯先验过渡到基于注意力的掩码以及自适应放宽——以与扩散生成动力学相匹配。广泛的实验在IBench上表明,SpatialID在文本遵循度(CLIP-T: 0.281)、视觉一致性(CLIP-I: 0.827)和图像质量(IQ: 0.523)方面实现了最佳性能,显著消除背景污染,同时保持稳健的身份保持。
引用
@article{arxiv.2602.13994,
title = {Inject Where It Matters: Training-Free Spatially-Adaptive Identity Preservation for Text-to-Image Personalization},
author = {Guandong Li and Mengxia Ye},
journal= {arXiv preprint arXiv:2602.13994},
year = {2026}
}