中文

面向连续控制的Actor-Critic型强化学习的蒙特卡罗束搜索

人工智能 2025-05-15 v1 机器学习

摘要

Actor-critic方法,如Twin Delayed Deep Deterministic Policy Gradient (TD3),依赖基本的基于噪声的探索,这可能导致次优的策略收敛。在本研究中,我们引入了蒙特卡罗束搜索(MCBS),一种新型混合方法,将束搜索和蒙特卡罗滚动结合到TD3中,以提高探索和动作选择。MCBS产生围绕策略输出的多个候选动作,并通过短期滚动评估它们,从而使智能体能够做出更有信息的选择。我们在各种连续控制基准测试中测试了MCBS,包括HalfCheetah-v4、Walker2d-v5和Swimmer-v5,显示出比标准TD3以及其他基线方法(如SAC、PPO和A2C)的更好的样本效率和性能。我们的发现突显了MCBS通过结构化前瞻搜索来增强策略学习能力的潜力,同时确保计算效率。此外,我们对关键超参数进行了详细分析,如束宽和滚动深度,并探索了优化MCBS以适应复杂控制任务的自适应策略。我们的方法在不同环境下的收敛速度高于TD3、SAC、PPO和A2C。例如,我们在约20万个时间步内即可达到90%的最高可达奖励,而第二名方法需要40万个时间步。

引用

@article{arxiv.2505.09029,
  title  = {Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control},
  author = {Hazim Alzorgan and Abolfazl Razi},
  journal= {arXiv preprint arXiv:2505.09029},
  year   = {2025}
}