中文

CPO:基于条件偏好优化的可控图像生成

计算机视觉与模式识别 2025-11-10 v1 人工智能 机器学习

摘要

为提高文本到图像生成的可控性,ControlNet引入了基于图像的控制信号,而ControlNet++提高了生成图像与输入控制信号之间像素级循环一致性。为避免通过采样过程进行反向传播的高昂成本,ControlNet++仅优化低噪声时刻 (如 t<200t < 200) 使用单步近似,这不仅忽略了高噪声时刻的贡献,也引入了额外的近似误差。一个直截了当的替代方法是直接偏好优化 (DPO),这是一种微调方法,增加模型对更可控图像 (Iw)I^{w}) 相对于不太可控图像 (Il)I^{l}) 的偏好。然而,由于生成模型的不确定性,很难确保胜负图像对仅在可控性上存在差异,同时保持其他因素(如图像质量)固定。为此,我们提出了对控制条件进行偏好学习,而非在生成图像上进行偏好学习。具体而言,我们构建胜利和失败的控制信号 cw\mathbf{c}^{w}cl\mathbf{c}^{l},并训练模型以偏好 cw\mathbf{c}^{w}。我们称之为条件偏好优化 (CPO)。该方法消除了混杂因素,yielding a low-variance训练目标。我们的理论分析表明,CPO的对比损失方差小于DPO,经实验证明其效果优于最先进的ControlNet++。此外,CPO在数据 curated方面需要更少的计算和存储。广泛的实验表明,CPO在多个控制类型上显著优于最先进技术, 在分割任务中将错误率降低超过10%,在人类姿态控制中降低70%-80%,在边缘和深度图控制中实现持续的2%-5%误差率降低。

关键词

引用

@article{arxiv.2511.04753,
  title  = {CPO: Condition Preference Optimization for Controllable Image Generation},
  author = {Zonglin Lyu and Ming Li and Xinxin Liu and Chen Chen},
  journal= {arXiv preprint arXiv:2511.04753},
  year   = {2025}
}