中文

文本到图像扩散模型的即时偏好对齐

计算机视觉与模式识别 2025-08-26 v1 人工智能

摘要

文本到图像 (T2I) 生成大大增强了创造表达,但以实时且无需训练的方式实现偏好对齐生成仍具有挑战性。以往方法常依赖静态的、预收集的偏好或微调,限制了对不断演变和细腻用户意图的适应性。在本文中,我们强调即时偏好对齐 T2I 生成的需求,并提出一种基于多模态大语言模型 (MLLM) 先验的训练-free 框架。我们的框架将任务分解为两个组件:偏好理解与偏好引导生成。对于偏好理解,我们利用 MLLM 从参考图像中自动提取全局偏好信号,并通过结构化指令设计丰富给定提示。这一方法支持比现有方法更广泛、更细致的用户偏好覆盖。对于偏好引导生成,我们集成全局关键词控制和局部区域感知的交叉注意力调制,以无需额外训练地引导扩散模型,实现对全局属性和局部元素的精确对齐。整个框架支持多轮交互式细化,促进实时且情境感知的图像生成。在 Viper 数据集和我们收集的基准数据集上的大量实验表明,我们的方法在定量指标和人类评估方面均优于先前方法,并为对话式生成和 MLLM-扩散集成开辟了新的可能性。

关键词

引用

@article{arxiv.2508.17718,
  title  = {Instant Preference Alignment for Text-to-Image Diffusion Models},
  author = {Yang Li and Songlin Yang and Xiaoxuan Han and Wei Wang and Jing Dong and Yueming Lyu and Ziyu Xue},
  journal= {arXiv preprint arXiv:2508.17718},
  year   = {2025}
}

备注

17 figures