InstructMoLE:用于多条件图像生成的指令引导低秩专家混合
计算机视觉与模式识别
2026-05-05 v3 人工智能
摘要
在处理多样的多条件任务时,使用 LoRA 等单体适配器对扩散 Transformer (DiT) 进行参数高效微调常会遇到任务干扰问题。低秩专家混合 架构提供了一种模块化解决方案,但其潜力通常受限于在词元级别运行的路由策略。这种局部路由可能与用户指令的全局性质相冲突,导致在复杂图像生成任务中出现空间碎片化和语义漂移等伪影。为了解决这些局限性,我们提出了 InstructMoLE,一个采用指令引导低秩专家混合的新框架。InstructMoLE 不使用逐词元路由,而是利用源自用户综合指令的全局路由信号——指令引导路由 (IGR)。这确保了一个单一且连贯选择的专家组统一应用于所有输入词元,从而保持生成过程的全局语义和结构完整性。作为补充,我们引入了输出空间正交性损失,以促进专家的功能多样性并缓解表征坍缩。大量实验表明,InstructMoLE 在具有挑战性的多条件生成基准上显著优于现有的 LoRA 适配器和 MoLE 变体。我们的工作为生成模型的指令驱动微调提出了一个稳健且可泛化的框架,实现了卓越的组合控制和对用户意图的忠实度。
引用
@article{arxiv.2512.21788,
title = {InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation},
author = {Jinqi Xiao and Qing Yan and Liming Jiang and Zichuan Liu and Hao Kang and Shen Sang and Tiancheng Zhi and Jing Liu and Cheng Yang and Xin Lu and Bo Yuan},
journal= {arXiv preprint arXiv:2512.21788},
year = {2026}
}