中文

Ortho-Hydra:用于 DiT LoRA 的正交化专家

机器学习 2026-05-06 v1 人工智能 计算机视觉与模式识别

摘要

DiT 扩散变换器在多风格数据上的 LoRA 微调 suffer 于 style bleed:单个低秩残差无法表示多个不同的艺术家指纹,优化器收敛到它们的平均值。HydraLoRA 风格的混合专家 LoRA 用 EE 个头替换上投影,但当每个专家都零初始化时,路由器从每个头接收相同的梯度并保持在均匀先验。随后,专家以置换对称方式演化,网络在 E×E{\times} 成本下训练为单个秩-rr LoRA。我们提出了 \textbf{Ortho-Hydra},一种结合 OFT 风格 Cayley-正交共享基和每个专家从预训练权重顶部 (Er)(Er) 左奇异向量中切割的“互斥输出子空间”的重新参数化。互斥性使路由器的每个专家得分在步骤 00 时非退化,从而在任何专家训练之前都获得专门化的梯度信号。我们通过在 DiT 管道上比较两个 HydraLoRA 基线(零初始化共享基变体和原始 σ=0.1\sigma{=}0.1 高斯抖动缓解方案)以及 Ortho-Hydra,在匹配的优化器、数据集和步数预算下进行测试。两个基线都未在前 1k1\text{k} 步内离开均匀先验;Ortho-Hydra 在前几个百数步就开始去均匀化。多风格数据上的端任务生成质量超出范围;我们报告构建过程、冷启动机制以及其改变的路由动力学。代码:https://github.com/sorryhyun/anima_lora。

关键词

引用

@article{arxiv.2605.03252,
  title  = {Ortho-Hydra: Orthogonalized Experts for DiT LoRA},
  author = {Seunghyun Ji},
  journal= {arXiv preprint arXiv:2605.03252},
  year   = {2026}
}