中文

利用最优传输增强手术机器人环境中的离线强化学习

人工智能 2023-10-16 v1 机器人学 机器学习

摘要

大多数强化学习(RL)方法传统上在主动学习设定中研究,即智能体直接与环境影响互、观察动作结果并通过试错学习。然而,允许部分训练的智能体与真实物理系统交互会带来重大挑战,包括高成本、安全风险以及持续监督之需。离线 RL 通过利用现有数据集并减少资源密集的实时交互需求,解决了这些成本与安全问题。尽管如此,一大挑战在于这些数据集须精心标注奖励。本文我们提出最优传输奖励(OTR)标注,一种创新算法,旨在利用少量高质量专家示范为离线轨迹分配奖励。OTR 的核心原理是采用最优传输(OT)计算数据集中未标注轨迹与专家示范之间的最优对齐,该对齐产生一种可有效解释为奖励信号的相似度度量。离线 RL 算法随后可利用这些奖励信号学习策略。此方法规避了手工设计奖励之需,释放了利用海量数据集进行策略学习的潜力。借助专为手术机器人学习定制的 SurRoL 仿真平台,我们生成数据集并采用 OTR 算法训练策略。通过在不同领域展示 OTR 的有效性,我们强调其通用性及加速 RL 跨广泛领域部署的潜力。

关键词

引用

@article{arxiv.2310.08841,
  title  = {Leveraging Optimal Transport for Enhanced Offline Reinforcement Learning in Surgical Robotic Environments},
  author = {Maryam Zare and Parham M. Kebria and Abbas Khosravi},
  journal= {arXiv preprint arXiv:2310.08841},
  year   = {2023}
}

备注

Preprint