引导不生成的内容:用于文本-图像对齐的自动化负提示
计算机视觉与模式识别
2025-12-12 v2 人工智能
摘要
尽管文本到图像生成取得了实质性进展,但实现精确的文本-图像对齐仍然具有挑战性,特别是对于具有丰富组合结构或想象元素的提示。为此,我们提出了负提示图像校正(Negative Prompting for Image Correction, NPC),一个通过识别和应用负提示来抑制不期望内容以改善对齐的自动化流程。我们首先分析交叉注意力模式,以解释为什么既有关联于提示对齐误差的定向负提示,也有关联于提示但出现在生成图像中的非定向负提示,都能增强对齐。为了发现有用的负提示,NPC 使用验证器-描述器-提议者框架生成候选提示,并通过显著文本空间评分进行排序,从而在不要求额外图像合成的情况下实现有效选择。在 GenEval++ 和 Imagine-Bench 上,NPC 优于强基线,在 GenEval++ 上达到 0.571 对比 0.371,并在 Imagine-Bench 上取得最佳整体性能。通过引导不生成的内容,NPC 为扩散模型中更强的文本-图像对齐提供了一条原则性的、完全自动化的途径。代码已发布于 https://github.com/wiarae/NPC。
引用
@article{arxiv.2512.07702,
title = {Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment},
author = {Sangha Park and Eunji Kim and Yeongtak Oh and Jooyoung Choi and Sungroh Yoon},
journal= {arXiv preprint arXiv:2512.07702},
year = {2025}
}
备注
WACV 2026