OMR-Diffusion:针对意图理解优化扩散模型中的多轮增强训练
计算机视觉与模式识别
2025-07-09 v3
摘要
生成式 AI 已显著推进文本驱动的图像生成,但在生成结果持续符合用户不断演变的偏好和意图方面仍面临挑战,尤其是在多轮对话场景中。本研究提出了一种视觉共适应 (VCA) 框架,引入人类在环反馈,利用专为贴近人类偏好而设计的经过训练的奖励模型。该框架基于多轮对话数据集,应用多种奖励函数(如多样性、一致性和偏好反馈),通过 LoRA 方式细化扩散模型,以用户输入为依据优化图像生成。我们还构建了符合用户意图的多轮对话数据集,包含提示词和图像配对。实验表明,该模型在人类评估中取得 508 场胜利,超过 DALL-E 3(463 场胜利)等。它在对话效率方面达到 3.4 轮(DALL-E 3 为 13.7 轮),并在 LPIPS(0.15)和 BLIP(0.59)等指标中表现突出。各种实验表明,所提方法在图像一致性和与用户意图对齐方面优于当前最先进的基线,取得显著改进。
引用
@article{arxiv.2503.17660,
title = {OMR-Diffusion:Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Intent Understanding},
author = {Kun Li and Jianhui Wang and Miao Zhang and Xueqian Wang},
journal= {arXiv preprint arXiv:2503.17660},
year = {2025}
}