RaDL:面向多实例文本到图像生成的关系感知解缠学习
计算机视觉与模式识别
2025-07-17 v1 人工智能
摘要
随着最近在文本到图像(T2I)模型方面的进展,有效地生成单个图像提示中的多个实例已成为关键挑战。现有方法虽然在生成单个实例的位置方面取得了成功,却往往难以考虑关系差异和多个属性泄漏。为解决这些限制,我们提出了关系感知解缠学习(RaDL)框架。RaDL 通过可学习参数增强实例特定的属性,通过 Relation Attention 生成关系感知的图像特征,利用从全局提示中提取的动作动词。通过在包括 COCO-Position、COCO-MIG 和 DrawBench 在内的基准测试上的广泛评估,我们展示了 RaDL 超越现有方法,显示出在位置精确性、多个属性考虑以及实例之间关系方面的显著改进。我们的结果将 RaDL 呈现为生成图像的解决方案,这些图像考虑了每个实例在多实例图像中的关系和多个属性。
引用
@article{arxiv.2507.11947,
title = {RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation},
author = {Geon Park and Seon Bin Kim and Gunho Jung and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2507.11947},
year = {2025}
}
备注
6 Pages