中文

ARISE: 自适应强化学习集成 Swarm Exploration

机器学习 2026-01-05 v1 系统与控制 系统与控制

摘要

有效探索是强化学习中的关键挑战,尤其是在非平稳奖励或高维策略情境下。我们引入ARISE,这是一个轻量级框架,通过在标准策略梯度方法中增添紧凑的群基探索层来增强强化学习。ARISE将策略动作与粒子驱动的提议相结合,其中每个粒子代表一个在动作空间中抽样得到的候选策略轨迹,并通过奖励方差线索自适应调制探索。虽然在简单基准测试上仅显示轻微改进(例如在CartPole-v1上+0.7%),ARISE在更具挑战性的任务上显著提升,包括在LunarLander-v3上+46%,在Hopper-v4上+22%,同时在Walker2d和Ant上保持稳定。在非平稳奖励变化情境下,ARISE提供了显著的鲁棒性优势,在CartPole上超越PPO+75分,并提升LunarLander的表现。消融研究确认,群组件和自适应机制均对性能贡献。总体而言,ARISE为构建更具探索性和鲁棒性的强化学习智能体提供了一个简单、与体系结构无关的途径,无需修改核心算法结构。

关键词

引用

@article{arxiv.2601.00693,
  title  = {ARISE: Adaptive Reinforcement Integrated with Swarm Exploration},
  author = {Rajiv Chaitanya M and D R Ramesh Babu},
  journal= {arXiv preprint arXiv:2601.00693},
  year   = {2026}
}

备注

12 pages. Accepted for presentation at WCSC 2026