中文

通过记忆增强 Transformer 实现所有(线性)一阶方法的可泛化学习

机器学习 2025-02-04 v3 最优化与控制

摘要

我们表明,记忆增强的 Transformer 可以实现整个线性一阶方法(LFOMs)的类,其中包含梯度下降(GD)以及更高级的方法,如共轭梯度下降(CGD)、动量方法以及所有线性组合过去梯度的其他变体。基于研究如何让 Transformer 模拟 GD 的 prior work,我们提供了理论和实证证据,表明记忆增强的 Transformer 能够学习更高级的算法。随后,我们采取一步步枯法,将所学习的算法转化为实际可用方法,通过开发一种混合专家(MoE)方法,用于针对离群(OOD)样本进行测试时适应。最后,我们表明 LFOMs 本身可以被视为可学习的算法,其参数可以从数据中学习以获得卓越性能。

关键词

引用

@article{arxiv.2410.07263,
  title  = {Toward generalizable learning of all (linear) first-order methods via memory augmented Transformers},
  author = {Sanchayan Dutta and Suvrit Sra},
  journal= {arXiv preprint arXiv:2410.07263},
  year   = {2025}
}