面向可自评估机器人任务的失败感知策略学习
机器人学
2023-02-28 v1
摘要
自评估规则在安全有效的真实世界机器人应用中起着至关重要的作用,其在实际执行前验证所选动作的可行性。但如何利用自评估结果重新选择动作仍是一项挑战。以往方法剔除经自评估规则判定为失败的动作,并选择可及性次高者(即消除过程策略[1]),忽略了自评估结果与被试剩余动作间的依赖性。然而该依赖性十分重要,因为先前的失败可能有助于修剪剩余被高估的动作。本文中,我们旨在通过学习的失败感知策略研究此依赖性。我们通过将先前失败的自我评估结果表示为可变状态,并利用循环神经网络隐式记忆先前失败,为失败感知策略提出两种架构。在三个任务上的实验表明,我们的方法能以更少尝试获得更高任务成功率与更优性能。此外,当动作相关时,学习失败感知策略可比消除过程策略取得更好性能。
引用
@article{arxiv.2302.13024,
title = {Failure-aware Policy Learning for Self-assessable Robotics Tasks},
author = {Kechun Xu and Runjian Chen and Shuqi Zhao and Zizhang Li and Hongxiang Yu and Ci Chen and Yue Wang and Rong Xiong},
journal= {arXiv preprint arXiv:2302.13024},
year = {2023}
}