中文

RT-HCP:应对推理延迟与样本效率以直接在机器人平台上学习

机器学习 2025-09-09 v1

摘要

直接在机器人上学习控制器需要极高的样本效率。基于模型的强化学习(RL)方法是样本效率最高的,但它们通常因推理时间过长而无法满足机器人控制频率的要求。在本文中,我们通过两项贡献来解决样本效率和推理时间的挑战。首先,我们定义了一个处理推理延迟的通用框架,其中慢速推理的机器人控制器提供一系列动作,以无执行间隙地供给需要高频控制的机器人平台。然后,我们在此框架下比较了几种强化学习算法,并提出了 RT-HCP,该算法在性能、样本效率和推理时间之间提供了出色的权衡。我们通过在简单但高频的 FURUTA 摆台上直接学习控制器的实验,验证了 RT-HCP 的优越性。代码:github.com/elasriz/RTHCP

关键词

引用

@article{arxiv.2509.06714,
  title  = {RT-HCP: Dealing with Inference Delays and Sample Efficiency to Learn Directly on Robotic Platforms},
  author = {Zakariae El Asri and Ibrahim Laiche and Clément Rambour and Olivier Sigaud and Nicolas Thome},
  journal= {arXiv preprint arXiv:2509.06714},
  year   = {2025}
}

备注

IROS 2025