中文

EruDiff:用于高级文本到图像合成的扩散模型中的知识重构

计算机视觉与模式识别 2026-03-24 v1

摘要

文本到图像扩散模型在合成来自明确文本提示的图像方面取得了显著的保真度,但在处理需要深层世界知识的隐式提示时表现缺乏,涉及从自然科学到文化常识的广泛领域,导致产生反事实合成结果。本文追溯这一局限性的根源,指向底层知识结构的根本性错位,表现为隐式提示相对于明确提示在组织结构上的混乱。本文提出EruDiff,旨在重构扩散模型中的知识。具体而言,我们开发了扩散知识分布匹配(DK-DM)机制,将难以处理的隐式提示的知识分布注册到已定义明确锚点的知识分布上。 Furthermore, 为纠正明确提示渲染中固有的偏见,我们采用仅负向强化学习(NO-RL)策略进行精细校正。严格的实证评估表明,我们的方法显著提升了包括 FLUX 和 Qwen-Image 在内的领先扩散模型在科学知识基准(即 Science-T2I)和世界知识基准(即 WISE)上的性能,凸显了方法的有效性与通用性。我们的代码已公开于 https://github.com/xiefan-guo/erudiff。

关键词

引用

@article{arxiv.2603.20828,
  title  = {EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis},
  author = {Xiefan Guo and Xinzhu Ma and Haoxiang Ma and Zihao Zhou and Di Huang},
  journal= {arXiv preprint arXiv:2603.20828},
  year   = {2026}
}