中文

MultLFG:基于频域引导的免训练多 LoRA 组合

计算机视觉与模式识别 2025-05-28 v1

摘要

低秩适应 (LoRA) 作为一种计算高效的微调生成模型方法已获得广泛关注,能以最小的开销实现独特的视觉概念合成。然而,当前方法在无需训练的情况下有效合并多个 LoRA 适配器方面仍存在困难,尤其是在涉及多样化视觉元素的复杂组合中。我们引入了 MultLFG,一个新颖的免训练多 LoRA 组合框架,利用频域引导实现多个 LoRA 的自适应融合。与统一聚合特定概念 LoRA 的现有方法不同,MultLFG 采用了一种时间步和频率子带自适应融合策略,根据特定时间步和频带的内容相关性选择性地激活相关 LoRA。这种频率敏感的引导不仅提高了空间一致性,还提供了对多 LoRA 组合更精细的控制,从而产生更准确、更一致的结果。在 ComposLoRA 基准上的实验评估表明,MultLFG 在各种风格和概念集上显著增强了组合保真度和图像质量,在多概念生成任务中优于最先进的基线方法。代码将发布。

关键词

引用

@article{arxiv.2505.20525,
  title  = {MultLFG: Training-free Multi-LoRA composition using Frequency-domain Guidance},
  author = {Aniket Roy and Maitreya Suin and Ketul Shah and Rama Chellappa},
  journal= {arXiv preprint arXiv:2505.20525},
  year   = {2025}
}