中文

基于区域感知双模直接偏好优化的构成式文本到图像生成

计算机视觉与模式识别 2026-05-28 v1

摘要

尽管文本到图像(T2I)模型取得了快速进展,但仍然面临着准确反映复杂构成提示(涵盖属性绑定、对象关系、计数)的挑战。为此,我们提出BiDPO框架来增强T2I模型在构成式文本到图像生成方面的能力。我们首先引入精心设计的管道来构建大规模偏好数据集BiComp,严格控制质量。然后,我们将扩散DPO扩展到联合优化图像和文本偏好,这在提高模型遵循复杂文本提示方面效果显著。为进一步增强模型以实现细粒度对齐,我们采用区域级指导方法,聚焦于与构成概念相关的区域。实验结果表明,我们的BiDPO在构成忠实度方面显著优于先前方法,在多个基准测试中 consistently 获胜。我们的ethods突显了基于偏好的微调在复杂文本到图像任务中的潜力,为现有技术提供了灵活且可扩展的替代方案。

关键词

引用

@article{arxiv.2605.28615,
  title  = {Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization},
  author = {Zhuohan Liu and Wujian Peng and Yitong Chen and Zuxuan Wu},
  journal= {arXiv preprint arXiv:2605.28615},
  year   = {2026}
}