中文

基于人类在回路中的贝叶斯优化的个性化图像生成

计算机视觉与模式识别 2026-02-05 v2 机器学习

摘要

设想阿丽莉脑中有一个特定图像 xx^*,比如她童年时所在街道的景象。为了生成恰好这个图像,她通过多轮提示引导生成模型,最终得到图像 xpx^{p*}。尽管 xpx^{p*}xx^* 相当接近,但阿丽莉发现仅靠语言提示难以缩小这一差距。本文观察到,即使语言已达到其限制,人类仍能判断新的图像 x+x^+ 是否比 xpx^{p*} 更接近 xx^*。基于此,我们开发了MultiBO(Multi-Choice Preferential Bayesian Optimization),该方法会根据 xpx^{p*} 小心地生成 KK 个新的图像,获取来自用户的偏好反馈,使用反馈引导扩散模型,最终生成新的一组 KK 个图像。在 BB 轮用户反馈后,即可显著接近 xx^*,尽管生成模型对 xx^* 没有任何信息。来自 3030 位用户的定性评分结合与 55 个基线相比较的定量指标显示,令人鼓舞的结果表明,来自人类的多选择反馈可以有效地用于个性化图像生成。

关键词

引用

@article{arxiv.2602.02388,
  title  = {Personalized Image Generation via Human-in-the-loop Bayesian Optimization},
  author = {Rajalaxmi Rajagopalan and Debottam Dutta and Yu-Lin Wei and Romit Roy Choudhury},
  journal= {arXiv preprint arXiv:2602.02388},
  year   = {2026}
}