中文

一种面向基于储备池代理的选择性注意力方法

机器学习 2025-03-03 v1

摘要

深度强化学习代理的训练因存在对奖励函数无有效制约的输入维度而显著放缓。诸如层归一化等现有模块可以通过权重衰减进行训练,作为一种选择性注意力(即输入掩码)来缩小不必要输入的尺度,从而加速策略的训练。然而,我们发现一个令人惊讶的结果:在输入掩码的计算中增加大量参数会使训练速度大幅提升。我们将一种简单的高维掩码模块与层归一化以及无任何输入抑制的模型进行了比较。结果表明,高维掩码相比零假设实现了四倍的训练加速,相比层归一化方法实现了两倍的训练加速。

关键词

引用

@article{arxiv.2502.21229,
  title  = {A Method of Selective Attention for Reservoir Based Agents},
  author = {Kevin McKee},
  journal= {arXiv preprint arXiv:2502.21229},
  year   = {2025}
}

备注

6 pages, 2 figures