HIVE:利用人类反馈进行指令式视觉编辑
计算机视觉与模式识别
2024-03-28 v2 人工智能
计算与语言
人机交互
机器学习
摘要
已有研究表明,融入人类反馈对于将大语言模型生成的文本对齐到人类偏好至关重要。我们假设,最先进的指令式图像编辑模型(基于输入图像和编辑指令生成输出)同样可从人类反馈中受益,因为其输出可能未遵循正确指令及用户偏好。在本文中,我们提出一种利用人类反馈进行指令式视觉编辑(HIVE)的新框架。具体而言,我们收集对编辑后图像的人类反馈,并学习一个奖励函数以捕捉潜在用户偏好。随后我们引入可扩展的扩散模型微调方法,能基于估计的奖励融入人类偏好。此外,为缓解数据局限性带来的偏差,我们贡献了一个新的 100 万训练数据集、一个 3.6K 奖励学习数据集和一个 1K 评估数据集,以提升指令式图像编辑的性能。我们进行了大量的定量与定性实证实验,表明 HIVE 以较大优势优于以往最先进的指令式图像编辑方法。
引用
@article{arxiv.2303.09618,
title = {HIVE: Harnessing Human Feedback for Instructional Visual Editing},
author = {Shu Zhang and Xinyi Yang and Yihao Feng and Can Qin and Chia-Chih Chen and Ning Yu and Zeyuan Chen and Huan Wang and Silvio Savarese and Stefano Ermon and Caiming Xiong and Ran Xu},
journal= {arXiv preprint arXiv:2303.09618},
year = {2024}
}
备注
In CVPR, 2024