DiAReL:面向鲁棒 Sim2Real 策略迁移的扰动感知强化学习在机器人控制中的应用
机器人学
2025-11-17 v2 机器学习
系统与控制
系统与控制
摘要
延迟马尔可夫决策过程(DMDP)通过用近期执行动作的有限时间窗扩充智能体的状态空间来满足马尔可夫性质。依赖这些状态扩充,延迟可解的强化学习算法训练策略以学习在具有观测或动作延迟的环境中的最优交互。尽管此类方法可直接在真实机器人上训练,但由于采样效率低、资源有限或安全约束,常见做法是将仿真中训练的模型迁移到物理机器人。然而,机器人仿真依赖于物理系统的近似模型,这阻碍了 sim2real 迁移。本工作中,我们将建模机器人或环境动力学时的各种不确定性视为施加于系统输入的未知内在扰动。我们引入延迟设定下的扰动增广马尔可夫决策过程(DAMDP)作为一种新颖表示,以在训练同策略强化学习算法时融入扰动估计。所提方法在多项指标上通过学习机器人到达与推动任务得到验证,并与无扰动感知的基线进行比较。结果表明,扰动增广模型能在控制响应中实现更高的稳定性与鲁棒性,从而提升成功 sim2real 迁移的前景。
引用
@article{arxiv.2306.09010,
title = {DiAReL: Reinforcement Learning with Disturbance Awareness for Robust Sim2Real Policy Transfer in Robot Control},
author = {Mohammadhossein Malmir and Josip Josifovski and Noah Klarmann and Alois Knoll},
journal= {arXiv preprint arXiv:2306.09010},
year = {2025}
}
备注
Accepted for publication in IEEE Transactions on Control Systems Technology (TCST)