戳与击:学习任务知情的探索策略
机器人学
2025-09-03 v1
摘要
在许多动态机器人任务中,例如将冰球击入可达工作空间外的球门,机器人必须首先识别物体的相关物理属性才能成功执行任务,因为其无法在失败后恢复或在无人工干预的情况下重试。为了应对这一挑战,我们提出了一种基于强化学习的任务知情探索方法,该方法利用由特权任务策略对估计属性误差的敏感度自动生成的奖励来训练探索策略。我们还引入了一种基于不确定性的机制,用于确定何时从探索过渡到任务执行,确保以最少的探索时间达到足够的属性估计精度。我们的方法在击打任务上实现了 90% 的成功率,平均探索时间不到 1.2 秒,显著优于成功率最高仅 40% 或需要在测试时在模拟器中进行低效查询和重训的基线方法。此外,我们证明了我们的任务知情奖励在击打任务和经典的 CartPole 例子中都捕捉到了物理属性的相对重要性。最后,我们通过使用 KUKA iiwa 机械臂在物理装置中识别物体属性并调整任务执行,验证了我们的方法。
引用
@article{arxiv.2509.00178,
title = {Poke and Strike: Learning Task-Informed Exploration Policies},
author = {Marina Y. Aoyama and Joao Moura and Juan Del Aguila Ferrandis and Sethu Vijayakumar},
journal= {arXiv preprint arXiv:2509.00178},
year = {2025}
}
备注
8 pages (main paper), 27 pages (including references and appendices), 6 figures (main paper), 21 figures (including appendices), Conference of Robot Learning 2025, For videos and the project website, see https://marina-aoyama.github.io/poke-and-strike/