基于多轮增强训练的扩散模型优化:提高偏好理解能力
计算机视觉与模式识别
2025-04-28 v1
摘要
生成式AI已通过实现文本驱动的图像生成显著改变各行业,但仍面临如何实现高分辨率输出以满足细粒度用户偏好挑战。因此,需要进行多轮交互以确保生成图像符合预期。以前的方法通过奖励反馈增强提示词,但未针对多轮对话数据集进行优化。本文提出了Visual Co-Adaptation (VCA)框架,集成人类在环反馈,利用与人类偏好对齐的已训练奖励模型。我们使用多样化的多轮对话数据集,应用多种奖励函数(如多样性、一致性和偏好反馈),通过LoRA对扩散模型进行微调,从而优化基于用户输入的图像生成。我们还构建了与用户意图对齐的多轮对话提示词和图像对数据集。实验表明,我们的方法优于最先进的基线,显著提高了图像的一致性和与用户意图的匹配度。该方法在用户满意度方面始终优于竞争模型,尤其在多轮对话场景中表现更佳。
引用
@article{arxiv.2504.18204,
title = {Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Preference Understanding},
author = {Kun Li and Jianhui Wang and Yangfan He and Xinyuan Song and Ruoyu Wang and Hongyang He and Wenxin Zhang and Jiaqi Chen and Keqin Li and Sida Li and Miao Zhang and Tianyu Shi and Xueqian Wang},
journal= {arXiv preprint arXiv:2504.18204},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2503.17660