Per-Query 视觉概念学习
计算机视觉与模式识别
2025-08-13 v1
摘要
视觉概念学习,亦称 Text-to-image 个人化,是为预训练模型教授新概念的过程。这在产品摆放、娱乐和个性化设计等方面具有诸多应用。我们展示,许多现有方法可以通过添加一个特定于提示和噪声种子的个人化步骤(以及基于自注意力和交叉注意力的两个损失项来捕捉个性化概念的身份)来显著增强。具体而言,我们利用 PDM 特征——此前用于捕捉身份——并展示了如何将其用于改进个性化语义相似性。我们评估了我们的方法在六种不同的个人化方法之上以及几个基础 Text-to-image 模型(包括 UNet 和 DiT 架构)所获益益。我们发现即使在之前的 per-query 个人化方法之上,也能获得显著的改进。
引用
@article{arxiv.2508.09045,
title = {Per-Query Visual Concept Learning},
author = {Ori Malca and Dvir Samuel and Gal Chechik},
journal= {arXiv preprint arXiv:2508.09045},
year = {2025}
}
备注
Project page is at https://per-query-visual-concept-learning.github.io/