FreeCus:面向扩散转换器的免训练主题定制
计算机视觉与模式识别
2025-07-22 v1
摘要
近年来,文本到图像 (T2I) 生成技术,尤其是扩散转换器 (DiT),取得了突破性进展,特别是主题驱动技术日益被用于高保真定制生产,这种生产保留来自参考输入的主题身份,为设计工作流程和娱乐体验提供了激动人心的可能性。现有的替代方案通常需要通过可训练文本嵌入实现主题优化,或在大规模数据集上训练专用编码器进行主题特征提取。这些对训练过程的依赖从根本上限制了其实际应用。更重要的是,当前的方法未充分利用现代扩散转换器(例如 Flux 系列)的内在零样本潜力,以实现真正的主题驱动合成。为弥合这一差距,我们提出了 FreeCus,一个真正无需训练的框架,通过三项关键创新来激发 DiT 的能力:1) 我们引入了一个关键注意力共享机制,在保持关键编辑灵活性的同时捕捉主题布局完整性。2) 通过对 DiT 动态位移的简单分析,我们提出了一种升级版方案,显著改进了细粒度特征提取。3) 我们进一步集成了高级多模态大语言模型 (MLLM),丰富跨模态语义表示。广泛的实验表明,我们的方法成功地解锁了 DiT 的零样本能力,实现了在多样化上下文中保持一致性的主题合成,实现了与需要额外训练的方法相当或更好的效果。值得注意的是,我们的框架与现有的 inpainting 流水线和控制模块实现了无缝兼容,促进了更具吸引力的体验。我们的代码已公开:https://github.com/Monalissaa/FreeCus。
引用
@article{arxiv.2507.15249,
title = {FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers},
author = {Yanbing Zhang and Zhe Wang and Qin Zhou and Mengping Yang},
journal= {arXiv preprint arXiv:2507.15249},
year = {2025}
}
备注
Accepted by ICCV 2025