中文

该梯度开心吗?

机器学习 2026-03-24 v1 人工智能 机器学习

摘要

策略梯度为每个样本计算反向传播,尽管反向传播代价高昂且大多数样本携带很少的学习价值。令人愉悦的策略梯度(DG)提供了学习价值的前向传递信号:\emph{愉悦},即 advantage 与 surprisal(负对数概率)的乘积。我们引入了\emph{kondo 门控器],该门控器将愉悦与计算成本进行比较,仅在样本值得时才支付反向传播,从而在质量-成本 Pareto 前沿上进行追踪。在 bandits 问题中,零价格门控保留了有用的梯度信号,同时消除了正交噪声,愉悦是比价值与惊讶的加法组合更可靠的筛选信号。在 MNIST 和 transformer token 反转任务上,kondo 门控跳过大多数反向传播,同时保留了 nearly all DG 的学习质量,且随问题难度增加和反向传播成本上升而呈现更大收益。由于该门控器容忍近似愉悦值,便可通过廉价的前向传递在昂贵的反向传播之前对样本进行筛选,这表明一种具有 speculative-decoding-for-training 范式的可能性。

关键词

引用

@article{arxiv.2603.20526,
  title  = {Does This Gradient Spark Joy?},
  author = {Ian Osband},
  journal= {arXiv preprint arXiv:2603.20526},
  year   = {2026}
}