在线增强学习到的抓取序列策略以实现更具适应性和数据效率的手内操作
机器人学
2023-04-06 v1
摘要
在使用工具时,用于拾取、重新摆放以及以适合所需任务的姿态握持工具的抓取可能是不同的。因此,自主手内工具操作的一个关键挑战是找到一系列抓取,在持续保持力闭合和稳定性的同时促进工具使用过程的每一步。由于建模接触动力学的复杂性,强化学习(RL)技术可以在受高度参数化物理模型约束的连续空间中提供解决方案。然而,这些技术在适应性和数据效率之间存在权衡。在测试时,工具属性、期望轨迹和期望施加力可能与训练场景大不相同。适应这一点需要更多数据或计算昂贵的在线策略更新。在这项工作中,我们应用离散动态规划(DP)的原理,以领域知识增强RL性能。具体而言,我们首先设计了一个计算简单的环境近似。然后我们在物理仿真中证明,使用该近似执行树搜索(即前瞻)和策略展开,可以用最少的额外在线计算改进RL导出的抓取序列策略。此外,我们展示了用DP导出的离散化问题解预训练深度RL网络可以加速策略训练。
引用
@article{arxiv.2304.02052,
title = {Online augmentation of learned grasp sequence policies for more adaptable and data-efficient in-hand manipulation},
author = {Ethan K. Gordon and Rana Soltani Zarrin},
journal= {arXiv preprint arXiv:2304.02052},
year = {2023}
}
备注
7 pages (6+1 bibliography), 4 figures, 1 table, 2 algorithms, to appear in ICRA 2023