中文

RaDL:面向多实例文本到图像生成的关系感知解缠学习

计算机视觉与模式识别 2025-07-17 v1 人工智能

摘要

随着最近在文本到图像(T2I)模型方面的进展,有效地生成单个图像提示中的多个实例已成为关键挑战。现有方法虽然在生成单个实例的位置方面取得了成功,却往往难以考虑关系差异和多个属性泄漏。为解决这些限制,我们提出了关系感知解缠学习(RaDL)框架。RaDL 通过可学习参数增强实例特定的属性,通过 Relation Attention 生成关系感知的图像特征,利用从全局提示中提取的动作动词。通过在包括 COCO-Position、COCO-MIG 和 DrawBench 在内的基准测试上的广泛评估,我们展示了 RaDL 超越现有方法,显示出在位置精确性、多个属性考虑以及实例之间关系方面的显著改进。我们的结果将 RaDL 呈现为生成图像的解决方案,这些图像考虑了每个实例在多实例图像中的关系和多个属性。

关键词

引用

@article{arxiv.2507.11947,
  title  = {RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation},
  author = {Geon Park and Seon Bin Kim and Gunho Jung and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2507.11947},
  year   = {2025}
}

备注

6 Pages