中文

Diff-Aid:用于矫正文本到图像生成的推理时自适应交互去噪

计算机视觉与模式识别 2026-03-02 v2

摘要

近期的文本到图像扩散模型取得了显著进展,但忠实地遵循复杂的文本描述仍具有挑战性,因为文本和视觉特征之间的交互不足。先前的方法通过架构设计或手工文本条件加权来增强此类交互,但缺乏灵活性,忽视了不同模块和去噪阶段的动态交互。为提供更灵活且高效的解决方案,本文提出Diff-Aid,一种轻量级推理时方法,通过自适应调整每个标记文本和图像交互,跨越transformer模块和去噪时间步。除提高生成质量外,Diff-Aid产生可解释的调制模式,揭示了不同模块、时间步和文本标记在去噪期间如何贡献于语义对齐。作为一个即插即用的模块,Diff-Aid可以无缝集成到下游应用中进行进一步改进,包括风格LoRAs、可控生成和零样本编辑。在强大的基线(SD 3.5和FLUX)上的实验表明,Diff-Aid在各种指标上在提示词遵循性、视觉质量和人类偏好方面均实现了一致的改进。我们的代码和模型将在发布后公开。

关键词

引用

@article{arxiv.2602.13585,
  title  = {Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation},
  author = {Binglei Li and Mengping Yang and Zhiyu Tan and Junping Zhang and Hao Li},
  journal= {arXiv preprint arXiv:2602.13585},
  year   = {2026}
}

备注

18 pages