使用分布式强化学习学习风险感知的四足运动
机器人学
2024-05-06 v2 机器学习
摘要
在危险环境中的部署要求机器人理解其动作与运动相关的风险以防止事故。尽管十分重要,目前部署的腿式机器人运动控制器并未显式建模这些风险。本工作中,我们提出一种采用分布式强化学习的风险敏感运动训练方法,以显式考虑安全性。我们估计完整的值分布以考量机器人与环境交互中的不确定性,而非依赖值期望。该值分布由风险度量消费以提取风险敏感值估计。这些估计被集成到近端策略优化(PPO)中推导出我们的方法——分布式近端策略优化(DPPO)。风险偏好(从风险厌恶到风险寻求)可由单一参数控制,从而能动态调整机器人行为。重要的是,我们的方法无需额外奖励函数调优即可实现风险敏感性。我们在仿真与四足机器人ANYmal上展示了涌现的风险敏感运动行为。实验视频与代码见 https://sites.google.com/leggedrobotics.com/risk-aware-locomotion。
引用
@article{arxiv.2309.14246,
title = {Learning Risk-Aware Quadrupedal Locomotion using Distributional Reinforcement Learning},
author = {Lukas Schneider and Jonas Frey and Takahiro Miki and Marco Hutter},
journal= {arXiv preprint arXiv:2309.14246},
year = {2024}
}