中文

FreeGraftor:无需训练的跨图像特征移植用于主体驱动文本到图像生成

计算机视觉与模式识别 2026-04-07 v5

摘要

主体驱动图像生成旨在合成新场景,同时忠实保留参考图像中主体的身份特征,并遵循文本指导。然而,现有方法在保真度与效率之间存在关键权衡。调优方法依赖耗时且资源密集的主体特定优化,而零样本方法往往难以维持足够的主体一致性。本文提出了FreeGraftor,一种无需训练的框架,通过跨图像特征移植来解决这些限制。具体而言,FreeGraftor利用语义匹配和位置约束注意力融合将参考主体的视觉细节传递到生成图像中。此外,我们的框架引入了一种新的噪声初始化策略,以保留参考主体的几何先验,促进稳健的特征匹配。大量定性和定量实验表明,该方法在无需模型微调或额外训练的情况下,实现了精确的主体身份传递,同时保持文本对齐的场景合成。FreeGraftor在主体保真度和文本对齐方面显著优于现有的零样本和无需训练方法。此外,该框架可以无缝扩展到多主体生成,具有实际部署的实用性。我们的代码已公开于https://github.com/Nihukat/FreeGraftor。

关键词

引用

@article{arxiv.2504.15958,
  title  = {FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation},
  author = {Zebin Yao and Lei Ren and Huixing Jiang and Wei Chen and Xiaojie Wang and Ruifan Li and Fangxiang Feng},
  journal= {arXiv preprint arXiv:2504.15958},
  year   = {2026}
}

备注

Code: https://github.com/Nihukat/FreeGraftor