Ortho-Hydra:用于 DiT LoRA 的正交化专家
机器学习
2026-05-06 v1 人工智能
计算机视觉与模式识别
摘要
DiT 扩散变换器在多风格数据上的 LoRA 微调 suffer 于 style bleed:单个低秩残差无法表示多个不同的艺术家指纹,优化器收敛到它们的平均值。HydraLoRA 风格的混合专家 LoRA 用 个头替换上投影,但当每个专家都零初始化时,路由器从每个头接收相同的梯度并保持在均匀先验。随后,专家以置换对称方式演化,网络在 成本下训练为单个秩- LoRA。我们提出了 \textbf{Ortho-Hydra},一种结合 OFT 风格 Cayley-正交共享基和每个专家从预训练权重顶部 左奇异向量中切割的“互斥输出子空间”的重新参数化。互斥性使路由器的每个专家得分在步骤 时非退化,从而在任何专家训练之前都获得专门化的梯度信号。我们通过在 DiT 管道上比较两个 HydraLoRA 基线(零初始化共享基变体和原始 高斯抖动缓解方案)以及 Ortho-Hydra,在匹配的优化器、数据集和步数预算下进行测试。两个基线都未在前 步内离开均匀先验;Ortho-Hydra 在前几个百数步就开始去均匀化。多风格数据上的端任务生成质量超出范围;我们报告构建过程、冷启动机制以及其改变的路由动力学。代码:https://github.com/sorryhyun/anima_lora。
引用
@article{arxiv.2605.03252,
title = {Ortho-Hydra: Orthogonalized Experts for DiT LoRA},
author = {Seunghyun Ji},
journal= {arXiv preprint arXiv:2605.03252},
year = {2026}
}