中文

一种具有群自适应学习率和权重衰减的自注意力元优化器

机器学习 2026-05-07 v1

摘要

自适应优化器如 AdamW 通常在所有参数组上应用统一的超参数,忽略了不同层和模块之间异构的优化动力学。我们通过提出 MetaAdamW - 一个集成自注意力机制以动态调制各参数组学习率和权重衰减的新型优化器来克服这一限制。调制因子由一个轻量级 Transformer 编码器产生,该编码器 operates on 从每个参数组中提取的统计特征(如梯度范数、动量范数、相关性)。为训练注意力模块,我们引入一种元学习目标,结合梯度对齐、损失减少和泛化间隙。一个关键新贡献是将同分布不确定性加权(HUW)扩展为具有任务特定优先级的版本,这直接缩放正则化项,从而使领域知识能够指导自动损失平衡。在针对五个多样化任务进行的大量实验中 - 时间序列预测(ETT)、语言建模(WikiText-2)、机器翻译(Multi30k)、图像分类(CIFAR-10)和情感分析(IMDB) - MetaAdamW 在验证损失、准确率或 perplexity 方面 consistently 优于标准 AdamW 基线。根据任务不同,MetaAdamW 要么减少整体训练时间(最高可降低 17.11%),要么提高性能(最高可提升 11.08%),同时仅引入适度的开销;在某些情况下,它还可以缓解因过早停止导致收敛不足的问题。消融研究验证了每个组件的有效性,包括特征版本、分组策略和提出的优先级注入不确定性加权。

关键词

引用

@article{arxiv.2605.04055,
  title  = {A Self-Attentive Meta-Optimizer with Group-Adaptive Learning Rates and Weight Decay},
  author = {JiangBo Zhao and ZhaoXin Liu},
  journal= {arXiv preprint arXiv:2605.04055},
  year   = {2026}
}