P3S-Diffusion:基于点监督的选择性主题生成框架
计算机视觉与模式识别
2025-01-07 v2 人工智能
摘要
近期的主题驱动生成研究越来越强调选择性主题特征的重要性。然而,在给定参考图像中准确选择内容仍然具有挑战性,尤其是当选择相似主题时(例如,两只不同颜色的狗)。一些方法试图使用文本提示或像素掩码来隔离特定元素。但文本提示在精确描述特定内容方面常常不足,像素掩码又往往成本高昂。为此,我们引入 P3S-Diffusion,一个用于点监督的上下文选择性主题生成框架的新型架构。P3S-Diffusion 利用最小成本标签(例如,点)生成主题驱动图像。在微调期间,它可以从这些点生成扩展的基准掩码,无需额外的分割模型。该掩码用于填充和与主题表示对齐。P3S-Diffusion 通过多层条件注入保留主题的细节特征。经过注意力一致性损失增强后,大量实验表明其在特征保留和图像生成方面表现优异。
引用
@article{arxiv.2412.19533,
title = {P3S-Diffusion:A Selective Subject-driven Generation Framework via Point Supervision},
author = {Junjie Hu and Shuyong Gao and Lingyi Hong and Qishan Wang and Yuzhou Zhao and Yan Wang and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2412.19533},
year = {2025}
}