HORST:稀疏 Transformer 训练的组合优化器几何
机器学习
2026-05-21 v1
摘要
稀疏化 transformer 仍是根本性挑战,因标准优化器无法同时鼓励稀疏性并维持训练稳定性。有效的自适应优化器表现出隐式 偏好以维持稳定性,而稀疏性需要 偏好。为整合稀疏性,我们提出优化步骤的组合,称为非交换算子,以原则性方式分析和组合其优化几何。这yield HORST(Robust Sparse Training 的 Hyperbolic Optimizer),一种模块化优化器,继承自适应方法的稳定性,同时通过双曲镜像映射诱导 稀疏性偏好。我们的实验表明,其在视觉和语言任务上的稀疏训练具有实用性。HORST 在所有稀疏水平上均显著并持续地超越 AdamW 基线,稀疏度越高,收益越大。
引用
@article{arxiv.2605.21104,
title = {HORST: Composing Optimizer Geometries for Sparse Transformer Training},
author = {Tom Jacobs and Rohan Jain and Rebekka Burkholz},
journal= {arXiv preprint arXiv:2605.21104},
year = {2026}
}
备注
22 pages, 8 figures