中文

Golden RPG:置信度自适应区域感知噪声用于组合文本到图像生成

计算机视觉与模式识别 2026-04-29 v1

摘要

组合文本到图像(T2I)生成需要模型遵循描述不同图像区域的多个子提示。近期研究表明扩散模型的“起始噪声”携带着重要语义信息:从文本预测的“黄金”噪声可显著提升提示保真度。我们观察到,这一噪声预测本质上是全局的:同一网络被要求用单个文本嵌入概述一个较长的多区域提示,这在提示描述具有空间分离实体的场景中成为瓶颈。我们引入Golden RPG,一种区域感知噪声预测器,通过在冻结NPNet上添加两个可训练模块实现:(i)针对每个区域的FiLM适配器,用于根据每个子提示重新塑形预测噪声;(ii)在Swin主干的两个阶段之间注入区域交叉注意力层,使不同空间位置能够关注不同的子提示标记。为防止区域条件化降低已很简单的提示样本的质量,我们进一步提出了置信度自适应混合头部,用于动态预测每个样本区域信号应如何覆盖全局信号。我们在原始RPG基准(20个提示,100个样本)和T2I-CompBench的四个多区域类别(1200张图像,六个竞争方法)上进行评估。Golden RPG在每个类别上均获得最高的Cross-Region-Coherence分数,同时在绝对CLIP-Score和CLIP-IQA方面与最强的基线相当。配对用户研究进一步显示,其偏好约为67%。该适配器包含约200万可训练参数,仅增加0.6秒的推理开销。

关键词

引用

@article{arxiv.2604.25314,
  title  = {Golden RPG: Confidence-Adaptive Region-Aware Noise for Compositional Text-to-Image Generation},
  author = {Hao Li},
  journal= {arXiv preprint arXiv:2604.25314},
  year   = {2026}
}

备注

13 pages