无训练主导的主体增强注意力指导用于组合文本到图像生成
计算机视觉与模式识别
2025-09-10 v1
摘要
现有主体驱动的文本到图像生成模型面临繁琐的微调步骤且难以维持文本-图像对齐与主体忠实性。对于生成组合主体,常遇到对象缺失和属性混合问题,其中输入提示中的一些主体未生成或其属性被错误组合。为解决这些限制,我们提出一种主体驱动的生成框架,并在推理阶段引入无训练指导以干预生成过程。该方法加强注意力图,从而实现对每个主体的精确属性绑定和特征注入。值得注意的是,我们的方法在挑战性的组合生成任务中展现出卓越的零样生成能力。此外,我们提出了新的度量 GroundingScore,用于全面评估主体对齐情况。获得的定量结果充分证明了我们方法的有效性。代码将很快公开。
引用
@article{arxiv.2405.06948,
title = {Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation},
author = {Shengyuan Liu and Bo Wang and Ye Ma and Te Yang and Xipeng Cao and Quan Chen and Han Li and Di Dong and Peng Jiang},
journal= {arXiv preprint arXiv:2405.06948},
year = {2025}
}
备注
26 pages, 13 figures