ConceptSplit:通过 Token 级自适应与注意力解耦实现扩散模型的解耦多概念个性化
计算机视觉与模式识别
2025-10-07 v1
摘要
近年来,用于文本到图像 (T2I) 扩散模型的多概念个性化以在图像中表示多个主体,受到了越来越多的关注。该任务的主要挑战是“概念混合”,即多个学习到的概念在输出图像中发生干扰或不良融合。为了解决这个问题,本文提出了 ConceptSplit,这是一个通过训练和推理拆分各个概念的新颖框架。我们的框架包含两个关键组件。首先,我们引入了 Token 级值自适应 (ToVA),这是一种无合并的训练方法,专注于自适应交叉注意力中的值投影。根据我们的经验分析,我们发现修改键投影(现有方法中的常见方法)会破坏注意力机制并导致概念混合。其次,我们提出了用于解耦注意力的潜在优化 (LODA),它通过优化输入潜在表示来缓解推理过程中的注意力纠缠。通过广泛的定性和定量实验,我们证明了 ConceptSplit 实现了稳健的多概念个性化,减轻了非预期的概念干扰。代码可在 https://github.com/KU-VGI/ConceptSplit 获取。
引用
@article{arxiv.2510.04668,
title = {ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-wise Adaptation and Attention Disentanglement},
author = {Habin Lim and Yeongseob Won and Juwon Seo and Gyeong-Moon Park},
journal= {arXiv preprint arXiv:2510.04668},
year = {2025}
}
备注
14 pages, 13 figures, to be published in ICCV 2025