LoRA.rar:基于超网络学习合并 LoRA 以实现主体-风格条件图像生成
计算机视觉与模式识别
2025-08-12 v2 人工智能
机器学习
摘要
近期图像生成模型的进展使得能够实现具有用户定义主体(内容)和风格的个性化图像创建。以往的做法通过优化方法合并相应的低秩适配器(LoRA),但计算密集且不适用于手机等资源受限设备。为此,我们提出 LoRArar 方法,不仅提升图像质量,还实现了超过 的合并速度提升。我们收集了风格与主体 LoRA 数据集,并在多样化的内容-风格 LoRA 对上预训练超网络,学习通用的高效合并策略,使其能泛化到新出现的、未见过的内容-风格配对,实现快速高质量的个性化生成。此外,我们发现现有内容-风格质量评估指标存在局限,提出采用多模态大语言模型(MLLM)构建新的评估协议以获得更准确的评估。我们的方法在内容保真度和风格保真度方面均显著优于当前最先进技术,经 MLLM 评估和人类评估均验证。
引用
@article{arxiv.2412.05148,
title = {LoRA.rar: Learning to Merge LoRAs via Hypernetworks for Subject-Style Conditioned Image Generation},
author = {Donald Shenaj and Ondrej Bohdal and Mete Ozay and Pietro Zanuttigh and Umberto Michieli},
journal= {arXiv preprint arXiv:2412.05148},
year = {2025}
}
备注
ICCV 2025. Project page: https://donaldssh.github.io/LoRA.rar