中文

ObjectComposer:无需微调的多物体一致性生成

计算机视觉与模式识别 2023-10-12 v1 机器学习

摘要

近期的文本到图像生成模型能够从文本提示生成高保真图像。然而,这些模型难以在不同上下文中以相同外观一致地生成相同物体。一致物体生成对于许多下游任务十分重要,例如生成具有一致角色与场景的漫画插图。众多方法试图通过对扩散模型进行微调来扩展其词汇以解决这个问题。然而,即便是轻量级微调方法,在大规模与实时场景下运行也可能成本高昂。我们提出了一种称为 ObjectComposer 的方法,用于生成与用户指定图像相似的多物体组合。我们的方法无需训练,利用了已有模型的能力。我们基于近期的 BLIP-Diffusion 模型构建,该模型可生成由参考图像指定的单物体图像。ObjectComposer 能够同时一致地生成包含多个特定物体的组合,且无需修改底层模型的权重。

关键词

引用

@article{arxiv.2310.06968,
  title  = {ObjectComposer: Consistent Generation of Multiple Objects Without Fine-tuning},
  author = {Alec Helbling and Evan Montoya and Duen Horng Chau},
  journal= {arXiv preprint arXiv:2310.06968},
  year   = {2023}
}