LLM 精调中的维度之福:一种方差-曲率视角
机器学习
2026-02-03 v1 人工智能
摘要
权重扰动演化策略(ES)能够以惊人的小规模(例如 )对亿参数语言模型进行精调,这与经典的零阶 curse-of-dimensionality 直觉相矛盾。我们还观察到第二个看似独立的现象:在固定超参数下,随机精调奖励常在 ES 和 GRPO 中先上升后下降。我们认为这两种效应反映了精调 landscape 的几何属性:它们在曲率上是低维的。一小组高曲率维度主导改进,产生(i)异构的时间尺度导致 rise-then-decay 在固定随机性下出现,如最小二乘随机上升模型所捕获;以及(ii)退化的改进更新,其中许多随机扰动在这些维度上共享类似分量。我们使用 ES 作为几何探针,对 GSM8K、ARC-C 和 WinoGrande 上的 Qwen2.5-Instruct 模型(0.5B--7B)的精调奖励 landscape 进行测量,发现奖励改进的扰动在小规模下仍然可被实证访问。综合这些结果,使 ES 的可扩展性与非单调训练动力学相协调,并表明高维精调可能容纳比最坏情况理论所暗示的更广泛的可行优化方法。
引用
@article{arxiv.2602.00170,
title = {The Blessing of Dimensionality in LLM Fine-tuning: A Variance-Curvature Perspective},
author = {Qiyao Liang and Jinyeop Song and Yizhou Liu and Jeff Gore and Ila Fiete and Risto Miikkulainen and Xin Qiu},
journal= {arXiv preprint arXiv:2602.00170},
year = {2026}
}
备注
8 pages, 6 figures, plus appendices