超大批量训练中的Fisher正交投影:超越均值,实现自然梯度下降
机器学习
2026-02-10 v3 人工智能
摘要
现代GPU配备大量高带宽内存,能够支持批量大小达数万甚至更大的训练样本。然而,大多数现有优化器在如此大的批量规模下难以有效工作。随着批量大小的增加,梯度噪声因在众多样本上的平均而减小,限制了一阶方法能够跳出尖锐或次优最小值并达到全局最小值。同时,类似自然梯度的二阶方法,如采用Kronecker分解近似曲率(KFAC)的方法,往往需要过高的阻尼才能在大批量情况下保持稳定。这种高阻尼实际上会淹没赋予这些方法优势的曲率信息,使其性能降至简单梯度下降的水平。本文引入了Fisher正交投影(FOP),一种新型技术,恢复了在极大批量下的二阶方法效能,实现了可扩展且具改进泛化能力和更快收敛速度的训练。FOP通过利用两个子批量的梯度构建方差感知的更新方向,将梯度差分在Fisher度量下与平均梯度的分量相结合,从而增强了平均梯度。
引用
@article{arxiv.2508.13898,
title = {Beyond the Mean: Fisher-Orthogonal Projection for Natural Gradient Descent in Large Batch Training},
author = {Yishun Lu and Wesley Armour},
journal= {arXiv preprint arXiv:2508.13898},
year = {2026}
}
备注
Accepted at Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26) (Oral)