线性回归与准牛顿方法在连续动作深度强化学习中的应用
机器学习
2025-04-28 v3 人工智能
摘要
线性回归(LR)方法具有优势——最优参数可相对容易计算,尽管其表示能力有限于深度学习技术。为改进深度强化学习,Levine 等人提出了 Least Squares Deep Q Network(LS-DQN) 方法,将 DQN 与 LR 方法结合。然而,LS-DQN 方法假设动作为离散。在本研究中,我们提出 Double Least Squares Deep Deterministic Policy Gradient(DLS-DDPG) 方法以解决这一限制。该方法将 LR 方法与 Deep Deterministic Policy Gradient(DDPG) 技术结合,后者是连续动作深度强化学习算法的代表。对于 LR 更新,DLS-DDPG 使用类似 Fitted Q iteration 的算法,即 LS-DQN 所采用的方法。此外,我们使用准牛顿方法计算最优动作,并将其作为 agent 的动作和 LR 更新的训练数据。MuJoCo 环境中的数值实验表明,所提方法在某些任务中改善了性能,尽管存在正则化项无法变小的困难。
引用
@article{arxiv.2503.14976,
title = {Application of linear regression and quasi-Newton methods to the deep reinforcement learning in continuous action cases},
author = {Hisato Komatsu},
journal= {arXiv preprint arXiv:2503.14976},
year = {2025}
}
备注
23 pages, 8 figures