中文

深度Delta学习

机器学习 2026-05-14 v3 人工智能 计算与语言 计算机视觉与模式识别

摘要

转换器残差流通过加法累积来演化:每一层将特征更新附加到共享的隐藏状态,但没有直接机制来替换已过时或冲突的内容。我们引入深度Delta学习 (DDL),一种保留身份路径同时赋予每个层 selectively 重写残差内容的更新规则。DDL读取当前状态 along 学习到的方向,与学习到的目标值比较,然后沿同一方向写回一个门控校正。当门关闭时,更新可简化为恒等式;当门完全打开时,选定的分量被覆盖,yielding 深度感知的delta-rule残差添加的广义。我们在仅包含解码器的语言模型中集成DDL,既适用于标量也适用于扩展的残差状态,同时保持注意力和MLP子层的原始计算宽度。受控预训练和下游评估显示,残差重写操作相对于ResNet中引入的纯加法累积提高了语言建模质量,表明学习到的delta-rule更新是管理转换器残差流的有效机制。

关键词

引用

@article{arxiv.2601.00417,
  title  = {Deep Delta Learning},
  author = {Yifan Zhang and Yifeng Liu and Mengdi Wang and Quanquan Gu},
  journal= {arXiv preprint arXiv:2601.00417},
  year   = {2026}
}

备注

Project Page: https://github.com/yifanzhang-pro/deep-delta-learning