FreeFuse:通过测试时自适应令牌级路由实现多主体LoRA融合
计算机视觉与模式识别
2026-01-30 v2
摘要
本文提出了FreeFuse,一个无需训练的多主体文本到图像生成框架,通过自动融合多个主体LoRA实现。与先前专注于重新训练LoRA以缓解特征冲突的研究不同,我们的分析揭示,简单地将主体LoRA的输出空间限制在其目标区域,并阻止其他LoRA直接侵入该区域,就足以有效缓解冲突。据此,我们在推理阶段实现了自适应令牌级路由。我们引入了FreeFuseAttn机制,该机制利用流匹配模型固有的语义对齐,在早期去噪时间步动态地将主体特定的令牌匹配到其对应的空间区域,从而绕过了对外部分割器的需求。FreeFuse以其高度的实用性脱颖而出:它不需要额外的训练、模型修改或用户定义的掩码空间条件。用户只需提供主体激活词,即可无缝集成到标准工作流程中。大量实验验证了FreeFuse在身份保持和构图保真度方面均优于现有方法。我们的代码可在 https://github.com/yaoliliu/FreeFuse 获取。
引用
@article{arxiv.2510.23515,
title = {FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time},
author = {Yaoli Liu and Yao-Xiang Ding and Kun Zhou},
journal= {arXiv preprint arXiv:2510.23515},
year = {2026}
}