从信息瓶颈视角弥合仿真到现实的鸿沟
机器学习
2024-10-15 v2 机器人学
摘要
强化学习(RL)近期在机器人控制中取得了显著成功。然而,多数 RL 工作运行在仿真环境中,其中特权知识(如动力学、周围环境、地形)易于获取。相反,在真实场景中,机器人智能体通常仅依赖局部状态(如机器人关节的本体的反馈)来选择动作,导致显著的仿真到现实的鸿沟(sim-to-real gap)。现有方法通过逐步减少对特权知识的依赖或执行两阶段策略模仿来应对此鸿沟。然而,我们认为这些方法在充分利用可用特权知识方面存在局限,导致次优性能。本文中,我们将仿真到现实的鸿沟表述为一个信息瓶颈问题,并由此提出一种称为历史信息瓶颈(HIB)的新颖特权知识蒸馏方法。具体而言,HIB 通过捕捉潜在可变动态信息,从历史轨迹中学习特权知识表示。理论分析表明,所学特权知识表示有助于减小 oracle 策略与学得策略之间的价值差异。在仿真与真实任务上的实证实验表明,HIB 相较先前方法具有更好的泛化性。真实实验视频见 https://sites.google.com/view/history-ib 。
引用
@article{arxiv.2305.18464,
title = {Bridging the Sim-to-Real Gap from the Information Bottleneck Perspective},
author = {Haoran He and Peilin Wu and Chenjia Bai and Hang Lai and Lingxiao Wang and Ling Pan and Xiaolin Hu and Weinan Zhang},
journal= {arXiv preprint arXiv:2305.18464},
year = {2024}
}
备注
Accepted by CoRL 2024