从次优示教中学习奖励函数及其在手术电灼中的应用
机器人学
2024-10-11 v2 人工智能
机器学习
摘要
通过示教学习(LfD)技术自动化机器人手术极具挑战性。这是因为手术任务通常涉及具有复杂物理对象交互的序贯决策过程,且对错误的容忍度低。先前的工作假设所有示教都是完全可观测且最优的,这在现实世界中可能不切实际。本文介绍了一种样本高效的方法,该方法从有限数量的、由部分视角点云观测组成的排序次优示教中学习鲁棒的奖励函数。然后,该方法通过使用强化学习(RL)优化学习到的奖励函数来学习策略。我们表明,使用学习到的奖励函数来获得策略比纯模仿学习更鲁棒。我们将我们的方法应用于一个物理手术电灼任务,并证明即使提供的示教是次优的且观测是高维点云,我们的方法也能表现良好。代码和视频见:https://sites.google.com/view/lfdinelectrocautery
引用
@article{arxiv.2404.07185,
title = {Reward Learning from Suboptimal Demonstrations with Applications in Surgical Electrocautery},
author = {Zohre Karimi and Shing-Hei Ho and Bao Thach and Alan Kuntz and Daniel S. Brown},
journal= {arXiv preprint arXiv:2404.07185},
year = {2024}
}
备注
In proceedings of the International Symposium on Medical Robotics (ISMR) 2024. Equal contribution from two first authors