中文

基于文本倒插的身份驱动文本增强与适应

计算机视觉与模式识别 2025-07-17 v1

摘要

最近,文本到图像扩散模型在进行个性化人像生成方面取得了显著进展,文本倒插(Textual Inversion)已成为一种有前景的创建高保真个性化图像的方法。尽管具有潜力,但当前的文本倒插方法在维持面部身份一致性方面存在挑战,因其在文本与视觉嵌入空间之间存在关于身份的语义错位。我们引入 ID-EA,一种新型框架,通过引导文本嵌入对齐视觉身份嵌入,从而提高身份保持在个性化生成中的表现。ID-EA 包含两个关键组件:身份驱动增强器(ID-Enhancer)和身份条件适配器(ID-Adapter)。首先,ID-Enhancer 将身份嵌入与文本身份锚点集成,通过代表性文本嵌入来细化从面部识别模型派生的视觉身份嵌入。随后,ID-Adapter 利用经身份增强的嵌入适应文本条件,通过调整预训练 UNet 模型中的跨注意力模块,确保身份保持。该过程鼓励文本特征在前景片段中寻找最相关的视觉线索。广泛的定量和定性评估表明,ID-EA 在身份保持指标上显著优于最先进的方法,同时实现了显著的计算效率,个性化人像生成速度约为现有方法的 15 倍。

关键词

引用

@article{arxiv.2507.11990,
  title  = {ID-EA: Identity-driven Text Enhancement and Adaptation with Textual Inversion for Personalized Text-to-Image Generation},
  author = {Hyun-Jun Jin and Young-Eun Kim and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2507.11990},
  year   = {2025}
}