DreamRelation:连接定制化与关系生成
计算机视觉与模式识别
2025-04-08 v4
摘要
定制化图像生成对于基于用户提示创建个性化内容至关重要,使大规模文本到图像扩散模型能够更有效地满足个体需求。然而,现有模型往往忽略生成图像中定制化对象之间的关系。本工作通过聚焦关系感知的定制化图像生成来解决这一空白,该方法旨在同时保留图像提示中的身份特征并维持文本提示中指定的关系。具体而言,我们提出 DreamRelation 框架,利用精心策划的数据集将身份学习与关系学习解耦。训练数据包含关系特定图像、包含身份信息的独立对象图像以及引导关系生成的文本提示。随后,我们提出两个关键模块来应对两个主要挑战:生成准确且自然的关系(尤其在需要大幅姿态调整时),以及在重叠情况下避免对象混淆。首先,我们引入关键点匹配损失,有效引导模型调整与关系密切相关的对象姿态。其次,我们融合图像提示的局部特征以更好地区分对象,防止重叠情况下的混淆。我们在所提出的基准数据集上的大量结果表明,DreamRelation 在保持多样化对象和关系身份的同时生成精确关系方面具有优越性。
引用
@article{arxiv.2410.23280,
title = {DreamRelation: Bridging Customization and Relation Generation},
author = {Qingyu Shi and Lu Qi and Jianzong Wu and Jinbin Bai and Jingbo Wang and Yunhai Tong and Xiangtai Li},
journal= {arXiv preprint arXiv:2410.23280},
year = {2025}
}
备注
CVPR 2025