面向手术机器人长时序任务策略学习的价值引导技能链
机器人学
2023-08-01 v1 人工智能
机器学习
摘要
由于策略探索的困难,强化学习在求解涉及多步骤且持续时间长的手术机器人长时序任务上仍面临挑战。近期方法尝试通过技能链解决该问题:将长时序任务分解为多个子任务以减轻探索负担,并将子任务策略按时间连接以完成整个长时序任务。然而,平滑连接所有子任务策略在手术机器人场景中是困难的。并非所有状态都同样适合连接两个相邻子任务。前一子任务的不期望终止状态会使当前子任务策略不稳定并导致执行失败。本工作中,我们提出价值引导技能链(ViSkill),一种面向手术机器人长时序任务的新型强化学习框架。其核心思想是区分哪些终止状态适合启动后续所有子任务策略。为实现该目标,我们引入状态值函数,用以估计给定状态下整个任务的期望成功概率。基于该值函数,学习一个链策略以指导子任务策略在值最高的状态处终止,从而使所有后续策略更有可能被连接以完成任务。我们在来自综合手术仿真平台 SurRoL 的三个复杂手术机器人任务上验证了方法的有效性,取得了高任务成功率与执行效率。代码见 。
引用
@article{arxiv.2307.16503,
title = {Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot},
author = {Tao Huang and Kai Chen and Wang Wei and Jianan Li and Yonghao Long and Qi Dou},
journal= {arXiv preprint arXiv:2307.16503},
year = {2023}
}
备注
Accepted to IROS 2023