缓解复杂 Q 函数中确定性策略梯度的次优性
机器学习
2025-10-13 v2 人工智能
机器人学
机器学习
摘要
在强化学习中,像 DDPG 和 TD3 这样的离策略演员-评论家方法使用确定性策略梯度:Q 函数从环境数据中学习,而演员通过梯度上升最大化它。我们观察到,在诸如灵巧操作和具有移动性约束的限制性运动等复杂任务中,Q 函数表现出许多局部最优,使得梯度上升容易陷入其中。为了解决这个问题,我们引入了 SAVO,一种演员架构,它 (i) 生成多个动作提议并选择具有最高 Q 值的那个,以及 (ii) 通过截断较差的局部最优来重复近似 Q 函数,以更有效地引导梯度上升。我们评估了诸如限制性运动、灵巧操作和大离散动作空间推荐系统等任务,并表明我们的演员更频繁地找到最优动作,并且优于替代的演员架构。
引用
@article{arxiv.2410.11833,
title = {Mitigating Suboptimality of Deterministic Policy Gradients in Complex Q-functions},
author = {Ayush Jain and Norio Kosaka and Xinhu Li and Kyung-Min Kim and Erdem Bıyık and Joseph J. Lim},
journal= {arXiv preprint arXiv:2410.11833},
year = {2025}
}
备注
Outstanding Paper Award on Empirical Reinforcement Learning Research, RLC 2025