中文

Flux早已知晓——无需训练激活主题驱动图像生成

计算机视觉与模式识别 2025-04-22 v2 人工智能

摘要

我们提出了一种简单而有效的零样本框架,用于使用原始Flux模型进行主题驱动图像生成。通过将任务构建为基于网格的图像补全,并简单地在马赛克布局中复制主题图像,我们激活了强大的身份保持能力,无需任何额外数据、训练或推理时微调。这种“免费午餐”方法通过新颖的级联注意力设计和元提示技术进一步增强,提高了保真度和多功能性。实验结果表明,我们的方法在基准测试和人类偏好研究的多个关键指标上优于基线,尽管在某些方面存在权衡。此外,它支持多种编辑,包括标志插入、虚拟试穿以及主题替换或插入。这些结果表明,预训练的文本到图像基础模型可以实现高质量、资源高效的主题驱动生成,为下游应用中的轻量级定制开辟了新的可能性。

关键词

引用

@article{arxiv.2504.11478,
  title  = {Flux Already Knows -- Activating Subject-Driven Image Generation without Training},
  author = {Hao Kang and Stathi Fotiadis and Liming Jiang and Qing Yan and Yumin Jia and Zichuan Liu and Min Jin Chong and Xin Lu},
  journal= {arXiv preprint arXiv:2504.11478},
  year   = {2025}
}