基于动作条件根均方 Q 函数的局部强化学习
机器学习
2026-04-06 v2 人工智能
摘要
Forward-Forward(FF)算法是一种近期提出的神经网络学习方法,采用两个前向传递代替传统的前向传播和反向传播。然而,FF 主要局限于监督场景,缺少学习信号可自然获得的领域,如强化学习。在本工作中,受 FF 利用层活动统计量的 goodness function 启发,我们提出 Action-conditioned Root mean squared Q-Functions(ARQ),这是一种新型价值估计方法,应用 goodness function 和动作条件化,用于基于时序差学习的局部强化学习。尽管其简单性和生物学依据,本方法在 MinAtar 和 DeepMind Control Suite 基准测试中优于当前基于无反向传播的局部强化学习方法,同时在大多数任务上也优于使用反向传播训练的算法。代码可在 https://github.com/agentic-learning-ai-lab/arq 查看。
引用
@article{arxiv.2510.06649,
title = {Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions},
author = {Frank Wu and Mengye Ren},
journal= {arXiv preprint arXiv:2510.06649},
year = {2026}
}
备注
18 pages, 11 figures