GateRA:面向参数高效微调的Token级调制
机器学习
2025-12-23 v3 人工智能
摘要
参数高效微调(PEFT)方法,如LoRA、DoRA和HiRA,enable通过低秩更新实现大型预训练模型的轻量级适应。然而,现有PEFT方法对所有token应用静态、输入无关的更新,忽略不同输入的重要性和难度差异。这种均匀处理可能导致对平凡内容过拟合或在更具信息性区域下适应不足,尤其是在自回归设置中存在明显的预填充和解码动态。在本文中,我们提出GateRA,一个统一框架,引入token级调制以动态调整PEFT更新的强度。通过将自适应门控整合到标准PEFT分支中,GateRA实现选择性、token级适应,为well-modeled的输入保留预训练知识,同时聚焦于具有挑战性的案例。经验可视化揭示了相位敏感行为,GateRA在处理冗余预填充token时自动抑制更新,在解码期间强调适应。为促进可信且高效的调制,我们进一步引入基于熵的正则化,以鼓励接近二元的门控决策。该正则化防止扩散更新模式,实现可解释、稀疏适应而无需硬阈值。最后,我们提出理论分析表明,GateRA在PEFT路径上产生软梯度掩码效应,实现对适应的连续可微控制。在多个常识推理基准测试中进行实验,结果表明GateRA在性能上一致优于或相当于现有PEFT方法。
引用
@article{arxiv.2511.17582,
title = {GateRA: Token-Aware Modulation for Parameter-Efficient Fine-Tuning},
author = {Jie Ou and Shuaihong Jiang and Yingjun Du and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2511.17582},
year = {2025}
}
备注
Accepted by AAAI 2026