基于截断扩散微调的数据无关扩散模型增强:Self-NPO
计算机视觉与模式识别
2025-11-18 v2
摘要
扩散模型在图像、视频和3D内容生成等各种视觉生成任务中取得了显著成功。偏好优化(PO)是旺盛且日益增长的研究领域,旨在将这些模型与人类偏好一致。虽然现有PO方法主要致力于产生有利的输出,但常常忽视了分类器无条件指导(CFG)在缓解不良结果方面的重要性。Diffusion-NPO通过引入负偏好优化(NPO)来弥补这一空白,即训练模型以生成与人类偏好相反的输出,从而通过CFG引导模型远离不利的结果。然而,先前的NPO方法依赖获取显式偏好标注的高成本且脆弱的程序(例如手动成对标注或奖励模型训练),限制了其在数据稀缺或难以获取的领域的实际应用。在本工作中,我们提出Self-NPO,即截断扩散微调,一种无数据的方法的负偏好优化,通过直接从模型本身学习来消除对手动数据标注或奖励模型训练的需求。这种无数据方法非常高效(仅需Diffusion-NPO的不到1%的训练成本),以无数据方式实现了与Diffusion-NPO相当的性能。我们展示了Self-NPO可无缝集成到广泛使用的扩散模型中,包括SD1.5、SDXL和CogVideoX,以及已针对人类偏好进行优化的模型,始终提升其生成质量和与人类偏好的一致性。代码已公开:https://github.com/G-U-N/Diffusion-NPO。
引用
@article{arxiv.2505.11777,
title = {Self-NPO: Data-Free Diffusion Model Enhancement via Truncated Diffusion Fine-Tuning},
author = {Fu-Yun Wang and Keqiang Sun and Yao Teng and Xihui Liu and Jiale Yuan and Jiaming Song and Hongsheng Li},
journal= {arXiv preprint arXiv:2505.11777},
year = {2025}
}
备注
accepted by AAAI 2026