中文

Break-A-Scene:从单张图像中提取多个概念

计算机视觉与模式识别 2023-12-14 v2 图形学 机器学习

摘要

文本到图像模型的个性化旨在将用户提供的概念引入模型,从而使其能在多样场景中合成该概念。然而,当前方法主要关注从具有背景与姿态变化的多个图像中学习单一概念的情况,在适配不同场景时表现不佳。在本工作中,我们引入了文本场景分解任务:给定一张可能包含若干概念的场景图像,我们旨在为每个概念提取一个独特的文本令牌,从而实现对生成场景的细粒度控制。为此,我们提出用指示目标概念存在的掩码来增强输入图像。这些掩码可由用户提供,或由预训练分割模型自动生成。随后,我们提出一种新颖的两阶段定制流程,优化一组专用文本嵌入(句柄)以及模型权重,在准确捕捉概念与避免过拟合之间取得微妙平衡。我们采用掩码扩散损失使句柄生成其分配的概念,并辅以针对交叉注意力图的新颖损失以防止纠缠。我们还引入联合采样(union-sampling),一种旨在提升生成图像中组合多个概念能力的训练策略。我们使用若干自动指标将我们的方法与多个基线进行定量比较,并通过用户研究进一步确认结果。最后,我们展示了我们方法的若干应用。项目页面见:https://omriavrahami.com/break-a-scene/

关键词

引用

@article{arxiv.2305.16311,
  title  = {Break-A-Scene: Extracting Multiple Concepts from a Single Image},
  author = {Omri Avrahami and Kfir Aberman and Ohad Fried and Daniel Cohen-Or and Dani Lischinski},
  journal= {arXiv preprint arXiv:2305.16311},
  year   = {2023}
}

备注

SIGGRAPH Asia 2023. Project page: at: https://omriavrahami.com/break-a-scene/ Video: https://www.youtube.com/watch?v=-9EA-BhizgM