OneActor: 基于聚类条件引导的一致角色生成
计算机视觉与模式识别
2024-10-29 v4 人工智能
摘要
文本到图像扩散模型通过高质量图像生成为艺术家带来便利。然而,其随机性阻碍了艺术家创建同一主题的一致图像。现有方法尝试以各种方式应对这一挑战并生成一致内容,但它们要么依赖外部受限数据,要么需要对扩散模型进行昂贵的微调。针对此问题,我们提出了一种新颖的一次性微调范式,称为OneActor。它通过学习的语义引导,仅由提示驱动高效地执行一致主题生成,从而避免了繁琐的主干网络微调。我们率先从聚类角度形式化一致主题生成的目标,并因此设计了聚类条件模型。为了缓解一次性微调流程中常见的过拟合挑战,我们使用辅助样本增强微调,并设计了两种推理策略:语义插值和聚类引导。这些技术后来被验证能显著提高生成质量。综合实验表明,我们的方法在主题一致性、提示遵循度和图像质量方面均优于多种基线方法。我们的方法能够进行多主题生成,并与流行的扩散扩展兼容。此外,与基于微调的基线相比,我们实现了4倍的微调速度提升,并且如果需要,可以避免增加推理时间。此外,我们的方法可以自然地用于从头预训练一致主题生成网络,从而将该研究任务应用于更实际的场景。(项目页面:https://johnneywang.github.io/OneActor-webpage/)
引用
@article{arxiv.2404.10267,
title = {OneActor: Consistent Character Generation via Cluster-Conditioned Guidance},
author = {Jiahao Wang and Caixia Yan and Haonan Lin and Weizhan Zhang and Mengmeng Wang and Tieliang Gong and Guang Dai and Hao Sun},
journal= {arXiv preprint arXiv:2404.10267},
year = {2024}
}