中文

面向鲁棒纯触觉手中操作的估计器耦合强化学习

机器人学 2024-01-09 v1 机器学习

摘要

本文识别并解决了将基于(强化)学习的控制器与状态估计器朴素结合用于机器人手中操作的问题。具体而言,我们处理了极具挑战性的任务:在手部朝下的条件下进行纯触觉、目标条件化的灵巧手中重定向。由于可用感知有限,许多在仿真中具备物体状态完整信息时可行的控制策略不允许精确的状态估计。因此,分开训练控制器与估计器并在测试时组合二者会导致性能不佳。我们通过在仿真训练期间将控制策略与状态估计器耦合来解决该问题。该方法带来了更鲁棒的状态估计和任务上更高的整体性能,同时保持了相对于端到端策略学习的可解释性优势。借助我们的 GPU 加速实现,从零开始学习的中位训练时间在一块低成本 GPU 上仅需 6.5 小时。在使用 DLR-Hand II 及四种显著差异物体形状的仿真实验中,我们深入分析了所提方法的性能。我们展示了成功的 sim2real 迁移:将四种物体旋转至 SO(3) 的 π/2\pi/2 离散化下的全部 24 个朝向,这在此前多样形状集合上从未实现。最后,我们的方法可连续将一个立方体重定向至九个(中位数)目标,超出了先前方法在这一挑战性设定下的能力范围。

关键词

引用

@article{arxiv.2311.04060,
  title  = {Estimator-Coupled Reinforcement Learning for Robust Purely Tactile In-Hand Manipulation},
  author = {Lennart Röstel and Johannes Pitz and Leon Sievers and Berthold Bäuml},
  journal= {arXiv preprint arXiv:2311.04060},
  year   = {2024}
}