中文

BideDPO:条件图像生成中的文本与条件同步对齐

计算机视觉与模式识别 2025-11-25 v1

摘要

条件图像生成通过结构、空间或风格先验条件提高文本到图像合成,但当前方法在处理源之间冲突方面存在挑战。这些包括 1) 输入层冲突,即条件图像与文本提示相矛盾,以及 2) 模型偏置冲突,即即使条件与文本匹配,生成偏置也会破坏对齐。解决这些冲突需要细致的解决方案,而标准的监督微调难以提供。基于偏好优化的技术,如直接偏好优化 (DPO) 表现有前景,但受限于文本和条件信号之间的梯度纠缠,以及缺乏多约束任务的无缝训练数据。为克服此问题,我们提出了双向解耦 DPO 框架 (BideDPO)。该方法创建两个解耦的偏好对—one 用于条件一个用于文本-以减少梯度纠缠。通过自适应损失平衡策略管理对的影响,以实现平衡的优化。我们引入一个自动化数据管道,用于抽样模型输出并生成 conflict-aware 数据。该过程嵌入迭代优化策略中,不断细化模型和数据。我们构建了一个 DualAlign 基准,用于评估文本与条件之间的冲突解决。实验表明 BideDPO 在文本成功率(例如 +35%)和条件遵循性方面显著提高。我们还使用 COCO 数据集验证了该方法。项目页面:https://limuloo.github.io/BideDPO/。

关键词

引用

@article{arxiv.2511.19268,
  title  = {BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment},
  author = {Dewei Zhou and Mingwei Li and Zongxin Yang and Yu Lu and Yunqiu Xu and Zhizhong Wang and Zeyi Huang and Yi Yang},
  journal= {arXiv preprint arXiv:2511.19268},
  year   = {2025}
}

备注

29 pages