TextCenGen: 注意力引导的以文本为中心的背景自适应文本到图像生成
计算机视觉与模式识别
2025-05-14 v5
摘要
文本到图像(T2I)生成在生成高质量图像方面取得了显著进展,但仍面临一个基本挑战:创建能够自然容纳文本放置而不损害图像质量的背景。这一能力对于图形设计等实际应用至关重要,因为在这些应用中,内容和文本之间清晰的视觉层次是必不可少的。先前的工作主要集中于在现有静态图像中安排布局,而未探索T2I模型生成文本友好背景的潜力。我们提出了TextCenGen,一种在空白区域进行无需训练的动态背景自适应方法,用于生成文本友好的图像。我们不是直接减少文本区域的注意力(这会降低图像质量),而是在背景优化之前重新定位冲突对象。我们的方法分析交叉注意力图以识别与文本区域重叠的冲突对象,并使用力导向图方法引导其重新定位,然后通过注意力排除约束确保背景平滑。我们的方法是即插即用的,无需额外训练,同时很好地平衡了语义保真度和视觉质量。在我们提出的包含四个种子数据集、共27,000张图像的文本友好T2I基准测试上,TextCenGen优于现有方法,在文本区域的显著性重叠降低了23%,同时保持了由CLIP分数和我们提出的视觉-文本一致性度量(VTCM)测量的98%的语义保真度。
引用
@article{arxiv.2404.11824,
title = {TextCenGen: Attention-Guided Text-Centric Background Adaptation for Text-to-Image Generation},
author = {Tianyi Liang and Jiangqi Liu and Yifei Huang and Shiqi Jiang and Jianshen Shi and Changbo Wang and Chenhui Li},
journal= {arXiv preprint arXiv:2404.11824},
year = {2025}
}
备注
7 pages, 7 figures