中文

用于文本到图像个性化的密钥锁定秩一编辑

计算机视觉与模式识别 2024-06-06 v2 人工智能 图形学

摘要

文本到图像模型(T2I)通过允许用户以自然语言引导创作过程,提供了新层次的灵活性。然而,使这些模型与用户提供的视觉概念对齐仍是一项挑战。T2I 个性化任务面临多重难题,例如在高视觉保真度的同时允许创意控制、在单张图像中组合多个个性化概念,以及保持较小的模型尺寸。我们提出 Perfusion,一种使用对底层 T2I 模型的动态秩一更新来解决这些挑战的 T2I 个性化方法。Perfusion 通过引入一种将新概念的交叉注意力 Keys 锁定至其上位类别的新机制来避免过拟合。此外,我们开发了门控秩一方法,使我们能在推理时控制所学概念的影响并组合多个概念。这以单个 100KB 训练模型实现了运行时效的视觉保真度与文本对齐平衡,该模型比当前 SOTA 小五个数量级。而且,它可在 Pareto 前沿上跨越不同工作点而无需额外训练。最后,我们表明 Perfusion 在定性与定量上均优于强基线。重要的是,与传统方法相比,密钥锁定带来了新颖结果,得以以前所未有的方式刻画个性化物体交互,即便在单样本设定下亦然。

关键词

引用

@article{arxiv.2305.01644,
  title  = {Key-Locked Rank One Editing for Text-to-Image Personalization},
  author = {Yoad Tewel and Rinon Gal and Gal Chechik and Yuval Atzmon},
  journal= {arXiv preprint arXiv:2305.01644},
  year   = {2024}
}

备注

Accepted to SIGGRAPH 2023. Project page is in https://research.nvidia.com/labs/par/Perfusion/