Focus-N-Fix:面向文本到图像生成的区域感知微调
计算机视觉与模式识别
2025-01-14 v1
摘要
文本到图像(T2I)生成近年来取得了显著进展,但在生成感知伪影、与复杂提示的对齐以及安全性方面仍然存在挑战。解决这些问题的常用方法包括收集生成图像上的人类反馈、训练奖励模型以估计人类反馈,然后基于奖励模型微调T2I模型以使其与人类偏好对齐。然而,虽然现有的奖励微调方法可以生成具有更高奖励的图像,但它们可能以意想不到的方式改变模型行为。例如,针对一个质量方面(如安全性)进行微调可能会降低其他方面(如提示对齐),或者可能导致奖励黑客行为(即找到一种增加奖励而不产生预期效果的方法)。在本文中,我们提出了Focus-N-Fix,一种区域感知微调方法,训练模型仅纠正先前有问题的图像区域。由此产生的微调模型生成与原始模型具有相同高层结构的图像,但在原始模型存在缺陷的区域(如安全性(过度性化和暴力)、合理性或其他标准)显示出显著改进。我们的实验表明,Focus-N-Fix改善了这些局部质量方面,而对其他方面几乎没有或完全没有退化,并且图像其余部分的变化通常难以察觉。免责声明:本文包含可能过度色情、暴力、冒犯或有害的图像。
引用
@article{arxiv.2501.06481,
title = {Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation},
author = {Xiaoying Xing and Avinab Saha and Junfeng He and Susan Hao and Paul Vicol and Moonkyung Ryu and Gang Li and Sahil Singla and Sarah Young and Yinxiao Li and Feng Yang and Deepak Ramachandran},
journal= {arXiv preprint arXiv:2501.06481},
year = {2025}
}