AutoLoRA:面向文本到图像生成的自动 LoRA 检索与细粒度门控融合
计算机视觉与模式识别
2025-08-05 v1
摘要
尽管近期通过大规模模型如 FLUX 和 Stable Diffusion v3 实现了逼真的图像生成,但这些架构的实际部署仍受限于其对参数微调的不可行性。虽然低秩适应 (LoRA) 在最小化参数开销的同时实现了模型定制,但有效利用分布式开源 LoRA 模块面临三个关键挑战:稀疏的元数据标注、对零样本适应能力的要求,以及多 LoRA 融合策略的次优。为解决这些限制,我们引入一个新框架,实现语义驱动的 LoRA 检索和动态聚合,包含两个关键组件:(1) 基于权重编码的 LoRA 检索器,在 LoRA 参数矩阵和文本提示之间建立共享语义空间,消除对原始训练数据的依赖;(2) 细粒度门控融合机制,在网络层和扩散时间步计算情境特定的融合权重,以最佳方式整合多个 LoRA 模块。我们的方法显著提升了图像生成性能,促进了基础模型的可扩展且数据高效的增强。本工作在社区开发的 LoRA 碎片化生态与实际部署需求之间搭建了关键桥梁,实现了通过标准化适配器集成的协作式模型演进。
引用
@article{arxiv.2508.02107,
title = {AutoLoRA: Automatic LoRA Retrieval and Fine-Grained Gated Fusion for Text-to-Image Generation},
author = {Zhiwen Li and Zhongjie Duan and Die Chen and Cen Chen and Daoyuan Chen and Yaliang Li and Yingda Chen},
journal= {arXiv preprint arXiv:2508.02107},
year = {2025}
}