PrefPaint:通过强化学习将图像填充扩散模型与人类偏好对齐
计算机视觉与模式识别
2024-11-05 v2
摘要
本文首次尝试通过强化学习框架将面向人类审美标准的图像填充扩散模型对齐,从而显著提高填充图像的质量和视觉吸引力。具体而言,与其直接衡量与配对图像之间的差异,不如使用我们构建的数据集(包含约 51,000 张标注了人类偏好的图像)训练奖励模型。随后,我们采用强化学习过程对预训练的图像填充扩散模型进行微调,使其分布朝向更高奖励的方向调整。此外,我们理论推导出奖励模型误差的上界,阐明了在强化对齐过程中奖励估计的潜在置信水平,从而促进了准确的正则化。在填充比较和下游任务(如图像延伸和 3D 重建)上的大量实验表明,我们的方法有效,显著优于当前最先进的方法,在人类偏好对齐方面取得了显著提升。该研究不仅推动了图像填充领域的发展,也为基于奖励准确性建模的生成模型迭代细化提供了框架,具有广泛的前景,适用于受视觉驱动的 AI 应用的设计。我们的代码和数据集已公开发布于 https://prefpaint.github.io。
引用
@article{arxiv.2410.21966,
title = {PrefPaint: Aligning Image Inpainting Diffusion Model with Human Preference},
author = {Kendong Liu and Zhiyu Zhu and Chuanhao Li and Hui Liu and Huanqiang Zeng and Junhui Hou},
journal= {arXiv preprint arXiv:2410.21966},
year = {2024}
}