基于局部两两距离匹配的无反向传播强化学习
机器学习
2025-07-16 v1 人工智能
机器学习
摘要
强化学习训练神经网络通常依赖于反向传播 (backpropagation, BP),这需要存储前向传递中的激活值以进行后续的反向更新。此外,通过多层传播误差信号常常导致梯度消失或爆炸,这会降低学习性能和稳定性。我们提出了一种新方法,在强化学习场景下利用前向传递中的局部信号来训练神经网络的每一层。该方法引入局部、层级损失,基于多维标度中的两两距离匹配原则,增强可选的奖励驱动导向。这一方法允许在前向传播期间计算的局部信号下训练每个隐藏层,从而消除反向传递和存储中间激活值的需求。我们的实验使用基于策略梯度的方法在常见的强化学习基准测试中进行,表明该无反向传播方法在性能上与其经典的 BP 基方法可比。此外,所提出的方法在运行内外以及跨运行之间提高了稳定性和一致性,尤其在具有挑战性的环境中表现出更好的性能。
引用
@article{arxiv.2507.11367,
title = {Local Pairwise Distance Matching for Backpropagation-Free Reinforcement Learning},
author = {Daniel Tanneberg},
journal= {arXiv preprint arXiv:2507.11367},
year = {2025}
}
备注
accepted at the European Conference on Artificial Intelligence (ECAI 2025)