HybridBooth:高效主体驱动生成的混合提示逆转
计算机视觉与模式识别
2024-10-11 v1
摘要
近期文本到图像扩散模型取得的进展展现了惊人的创造能力,但基于特定主体的个性化生成(称为subject-driven generation)仍具有挑战。为解决此问题,我们提出一种新的混合框架HybridBooth,将优化导向方法和直接回归方法的优势融合。HybridBooth在两个阶段运行:Word Embedding Probe生成稳健的初始词嵌入,利用微调的编码器;随后Word Embedding Refinement进一步适应特定主体图像,通过优化关键参数。该方法即使仅从单个图像就能实现视觉概念向文本嵌入的有效且快速的逆转,同时保持模型的泛化能力。
引用
@article{arxiv.2410.08192,
title = {HybridBooth: Hybrid Prompt Inversion for Efficient Subject-Driven Generation},
author = {Shanyan Guan and Yanhao Ge and Ying Tai and Jian Yang and Wei Li and Mingyu You},
journal= {arXiv preprint arXiv:2410.08192},
year = {2024}
}
备注
ECCV 2024, the project page: https://sites.google.com/view/hybridbooth