基于多臂老虎机的风险感知强化学习用于四足 locomotion
机器人学
2025-10-17 v1
摘要
在本工作中,我们研究针对四足 locomotion 的风险感知强化学习。我们的methods训练一族风险条件化策略,使用Conditional Value-at-Risk(CVaR)约束的策略优化技术提供更好的稳定性和样本效率。在部署时,我们使用多臂老虎机框架仅基于观察到的episodic回报(无需任何特权环境信息)自适应选择最佳策略,并适应未知条件。因此,我们在各种鲁棒性水平上训练四足 locomotion 策略,并在线自适应选择所需的鲁棒性水平,以确保在未知环境中的性能。我们在八个未见过的环境中(通过改变动力学、接触、感知噪声和地形)进行评估,并在Unitree Go2机器人上进行了以前未见过地形的测试。我们的风险感知策略在未知环境中的平均值和尾部性能几乎翻了一番,而且我们的多臂老虎机适应性选择在未知地形中最佳的风险感知策略只需两分钟即可完成。
引用
@article{arxiv.2510.14338,
title = {Risk-Aware Reinforcement Learning with Bandit-Based Adaptation for Quadrupedal Locomotion},
author = {Yuanhong Zeng and Anushri Dixit},
journal= {arXiv preprint arXiv:2510.14338},
year = {2025}
}