曲率调节:基于单一参数的可证明免训练模型引导
机器学习
2026-01-16 v5
摘要
模型和数据规模的扩展重塑了 AI 格局,确立了将预训练模型微调作为解决下游任务的标准范式。然而,主流的微调方法通常依赖于权重适应,往往缺乏可解释性,并且依赖于启发式选择的超参数。在本文中,我们采取了不同的视角,将焦点从权重转移到激活函数,通过样条算子的视角来观察它们。我们提出了曲率调节,这是一种可解释且有原则的引导方法,通过向模型的激活函数中注入单一超参数来调节模型的决策边界。我们表明,CT 可证明地调整了模型决策边界的曲率,并且更根本地,将模型投影到光滑函数空间——从而补充了当前的微调方法,其效果主要体现在特征适应上。使该超参数可训练,便产生了一种新颖且高度参数高效的微调方法。在实验中,CT 提高了泛化能力和鲁棒性。例如,在 12 个数据集上,它将 ResNet-50/152 的下游准确率比线性探测提高了 8.59%/8.34%,比 LoRA 提高了 4.64%/1.70%,并在 RobustBench 的 基准上将鲁棒准确率提高了 1032.64%/1494.46%。我们的代码可在 https://github.com/Leon-Leyang/curvature-tuning 获取。
引用
@article{arxiv.2502.07783,
title = {Curvature Tuning: Provable Training-free Model Steering From a Single Parameter},
author = {Leyang Hu and Matteo Gamba and Randall Balestriero},
journal= {arXiv preprint arXiv:2502.07783},
year = {2026}
}
备注
Accepted at NeurIPS 2025