中文

面向文本到图像生成的检测器到可微评论家 D2D

计算机视觉与模式识别 2025-10-23 v1

摘要

文本到图像(T2I)扩散模型在语义对齐方面取得了强大的性能,但仍在生成提示中指定的正确对象数量方面存在挑战。现有方法通常将计数网络作为外部评论家纳入,以增强数值正确性。然而,由于这些评论家必须在生成过程中提供梯度引导,他们局限于必须是可微的回归模型,从而排除了计数能力更好的检测器模型,这些模型的计数-枚举本质是不可微的。为克服这一限制,我们提出了检测器到可微评论家(D2D)的新方法,通过将非可微检测器模型转换为可微评论家,从而利用其优越的计数能力来指导数值生成。具体而言,我们设计了自定义激活函数将检测器 logits 转换为软二元指示器,然后用于在推理时间使用预训练 T2I 模型优化噪声先验。我们在 SDXL-Turbo、SD-Turbo 和 Pixart-DMD 上进行了大量实验,覆盖四个不同复杂度的基准(低密度、高密度和多对象场景),在对象计数准确性方面实现了一致且显著的改进(例如,在 D2D-Small 上提升了最高 13.7%,该基准包含 400 条提示的低密度场景),同时在整体图像质量和计算开销方面几乎没有退化。

关键词

引用

@article{arxiv.2510.19278,
  title  = {D2D: Detector-to-Differentiable Critic for Improved Numeracy in Text-to-Image Generation},
  author = {Nobline Yoo and Olga Russakovsky and Ye Zhu},
  journal= {arXiv preprint arXiv:2510.19278},
  year   = {2025}
}

备注

24 pages, 14 figures