扩散混合:扩散模型的推理时多偏好对齐
人工智能
2026-03-13 v2 计算机视觉与模式识别
摘要
近期强化学习(RL)算法被用于通过微调扩散模型以适应下游目标(如审美质量和文本图像一致性),在固定KL正则化下最大化单个奖励函数。然而,这种方法在实际中受限于必须在多目标之间进行平衡,而这些目标常常相互冲突。此外,用户偏好会因提示、个人和部署环境而异,对偏离预训练基础模型的容忍度也不同。我们解决多偏好对齐的推理时问题:给定一组基准奖励函数和参考KL正则化强度,是否可以设计微调程序,以便在推理时,能够生成与用户指定的奖励和正则化任何线性组合对齐的图像,而无需额外微调?我们提出扩散混合(Diffusion Blend),一种解决推理时多偏好对齐的新方法,通过混合与微调模型相关的反向扩散过程实现。我们用两种算法实现了该方法:DB-MPA用于多奖励对齐,DB-KLA用于KL正则化控制。大量实验表明,扩散混合算法始终优于相关基线方法,接近或超过各个单独微调模型的性能,实现了推理时高效的用户驱动对齐。代码可在 https://github.com/bluewoods127/DB-2025 获取。
引用
@article{arxiv.2505.18547,
title = {Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models},
author = {Min Cheng and Fatemeh Doudi and Dileep Kalathil and Mohammad Ghavamzadeh and Panganamala R. Kumar},
journal= {arXiv preprint arXiv:2505.18547},
year = {2026}
}
备注
Accepted at ICLR 2026