中文

IMG:通过隐式多模态引导校准扩散模型

计算机视觉与模式识别 2025-10-01 v1

摘要

确保扩散模型生成的图像与输入提示之间的精确多模态对齐一直是一个长期挑战。早期工作使用高质量偏好数据微调扩散权重,但这些数据往往有限且难以扩展。最近基于编辑的方法进一步细化生成图像的局部区域,但可能损害整体图像质量。在这项工作中,我们提出隐式多模态引导(IMG),这是一种新颖的基于重新生成的多模态对齐框架,无需额外数据或编辑操作。具体来说,给定一张生成的图像及其提示,IMG a) 利用多模态大语言模型(MLLM)识别未对齐之处;b) 引入一个隐式对齐器,通过操纵扩散条件特征来减少未对齐并实现重新生成;c) 将重新对齐目标形式化为一个可训练的目标,即迭代更新偏好目标。在SDXL、SDXL-DPO和FLUX上的大量定性和定量评估表明,IMG优于现有的对齐方法。此外,IMG作为一个灵活的即插即用适配器,能无缝增强先前基于微调的对齐方法。我们的代码将发布在 https://github.com/SHI-Labs/IMG-Multimodal-Diffusion-Alignment。

关键词

引用

@article{arxiv.2509.26231,
  title  = {IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance},
  author = {Jiayi Guo and Chuanhao Yan and Xingqian Xu and Yulin Wang and Kai Wang and Gao Huang and Humphrey Shi},
  journal= {arXiv preprint arXiv:2509.26231},
  year   = {2025}
}

备注

ICCV 2025