利用最优传输增强手术机器人环境中的离线强化学习
人工智能
2023-10-16 v1 机器人学
机器学习
摘要
大多数强化学习(RL)方法传统上在主动学习设定中研究,即智能体直接与环境影响互、观察动作结果并通过试错学习。然而,允许部分训练的智能体与真实物理系统交互会带来重大挑战,包括高成本、安全风险以及持续监督之需。离线 RL 通过利用现有数据集并减少资源密集的实时交互需求,解决了这些成本与安全问题。尽管如此,一大挑战在于这些数据集须精心标注奖励。本文我们提出最优传输奖励(OTR)标注,一种创新算法,旨在利用少量高质量专家示范为离线轨迹分配奖励。OTR 的核心原理是采用最优传输(OT)计算数据集中未标注轨迹与专家示范之间的最优对齐,该对齐产生一种可有效解释为奖励信号的相似度度量。离线 RL 算法随后可利用这些奖励信号学习策略。此方法规避了手工设计奖励之需,释放了利用海量数据集进行策略学习的潜力。借助专为手术机器人学习定制的 SurRoL 仿真平台,我们生成数据集并采用 OTR 算法训练策略。通过在不同领域展示 OTR 的有效性,我们强调其通用性及加速 RL 跨广泛领域部署的潜力。
引用
@article{arxiv.2310.08841,
title = {Leveraging Optimal Transport for Enhanced Offline Reinforcement Learning in Surgical Robotic Environments},
author = {Maryam Zare and Parham M. Kebria and Abbas Khosravi},
journal= {arXiv preprint arXiv:2310.08841},
year = {2023}
}
备注
Preprint