S0 调谐:混合循环-注意模型的零开销适应
计算与语言
2026-04-07 v2 机器学习
摘要
使用约48个经执行验证的人类评估训练解决方案,对单个初始状态矩阵进行每层循环层的调谐,推出零推理开销的S0调谐方法,显著优于LoRA +10.8pp(p<0.001)。该方法为每个循环层优化一个状态矩阵,同时冻结所有模型权重。在Qwen3.5-4B(GatedDeltaNet混合)上,S0调谐使贪心通过@1提升+23.6±1.7pp(10个随机种子)。在FalconH1-7B(Mamba-2混合)上,S0达到71.8%±1.3,LoRA达到71.4%±2.4(3个随机种子),在此样本量下统计上不可区分,同时无需权重合并。跨域迁移在MATH-500(+4.8pp,p=0.00002,8个随机种子)和GSM8K(+2.8pp,p=0.0003,10个随机种子)上显著;文本到SQL基准(Spider)显示无迁移,符合轨迹引导机制。Qwen2.5-3B纯Transformer上,前缀调谐控制在所有九种配置下均以-13.9pp性能下降。在Qwen3.5上,基于每步状态偏移的变体达到+27.1pp,高于S0和LoRA,但每步推理成本增加。综上所述,结果表明当监督信号稀缺时,循环状态初始化是混合语言模型的强大零推理开销PEFT表面。调谐后的状态文件约48MB;任务切换无需权重合并或模型重新加载。代码与库:https://github.com/jackyoung27/s0-tuning.
引用
@article{arxiv.2604.01168,
title = {S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models},
author = {Jack Young},
journal= {arXiv preprint arXiv:2604.01168},
year = {2026}
}
备注
15 pages (10 main + 5 appendix), 3 figures, code at https://github.com/jackyoung27/s0-tuning