中文

维持强化学习中的可塑性:面向非平稳环境中空中机器人控制的代价感知框架

机器人学 2025-03-11 v2

摘要

强化学习(RL)已展现出在短期训练中维持空中机器人控制策略可塑性的能力。然而,这些策略在扩展到非平稳环境中的长期学习时已被证明会丧失可塑性。例如,标准的近端策略优化(PPO)策略在长期训练设置中观察到策略崩溃,并导致显著的控制性能退化。为解决这一问题,本工作提出了一种代价感知框架,利用回顾性代价机制(RECOM)在非平稳环境中平衡 RL 训练中的奖励与损失。利用奖励与损失之间的代价梯度关系,我们的框架动态更新学习率,以主动训练在受扰动风环境中的控制策略。实验结果表明,我们的框架在可变风条件下学习到了不会发生策略崩溃的悬停任务策略,其休眠单元数量比使用 PPO 的 L2 正则化少 11.29%。

关键词

引用

@article{arxiv.2503.00282,
  title  = {Maintaining Plasticity in Reinforcement Learning: A Cost-Aware Framework for Aerial Robot Control in Non-stationary Environments},
  author = {Ali Tahir Karasahin and Ziniu Wu and Basaran Bahadir Kocer},
  journal= {arXiv preprint arXiv:2503.00282},
  year   = {2025}
}