中文

基于概率协同调整函数的物理信息强化学习

机器学习 2023-09-12 v1 系统与控制 系统与控制

摘要

真实世界任务的强化学习数据效率极低,基于大量仿真建模已成为训练系统的主导方法。然而,在人-机器人交互及许多真实场景中,由于系统个体实例(如不同人)的差异或仿真模型中必要的过度简化,并不存在适用的“一模型适万物”。这需要两种途径:1. 从数据近似学习个体系统动力学,需数据密集型训练;或 2. 使用实例的完整数字孪生,这在许多情况下可能无法实现。我们提出协同克里金调整(CKA)与岭回归调整(RRA)两种新方法,以结合两者优势。我们的调整方法基于自回归 AR1 协同克里金模型,并将其与 GP 先验集成,从而以数据与仿真高效的方式使用简化仿真模型(如简单双连杆模型)并快速适配个体实例(如个体的生物力学)。利用 CKA 与 RRA,我们比纯基于 GP 与 AR1 的方法获得了更精确的全系统动力学不确定性量化。我们以可解释强化学习控制为例展示协同克里金调整的效率:仅用双连杆臂仿真模型(离线部分)与少量交互数据导出的 CKA(在线即时)学习控制生物力学人体手臂。我们的方法为在仅有不完美仿真模型的真实复杂系统中实现高效且感知不确定性的强化学习开辟了途径。

关键词

引用

@article{arxiv.2309.05404,
  title  = {Physics-informed reinforcement learning via probabilistic co-adjustment functions},
  author = {Nat Wannawas and A. Aldo Faisal},
  journal= {arXiv preprint arXiv:2309.05404},
  year   = {2023}
}