CoTaP:柔顺任务流水线及其基于柔顺调制的控制器强化学习
机器人学
2025-10-08 v2
摘要
仿人机器人全身运动控制是仿人机器人发挥其固有优势的关键途径。基于重定向人类运动数据的学习型控制方法为解决这一问题提供了有效手段。然而,由于当前大多数人类数据集缺乏测力数据,且基于学习的机器人控制大多基于位置,在与真实环境交互时实现适当的柔顺性仍具挑战。本文提出了柔顺任务流水线:一种在仿人机器人基于学习的结构中利用柔顺性信息的流水线。提出了一种结合基于模型的柔顺控制、适用于仿人机器人的两阶段双智能体强化学习框架。在训练过程中,首先训练带有基于位置控制器的基策略;然后在蒸馏阶段,将上半身策略与基于模型的柔顺控制相结合,下半身智能体由基策略引导。在上半身控制中,可通过在对称正定(SPD)流形上的柔顺调制指定可调的任务空间柔顺性,并与其他控制器集成,从而确保系统稳定性。我们在仿真中验证了所提策略的可行性,主要比较了不同柔顺设置下对外部扰动的响应。
引用
@article{arxiv.2509.25443,
title = {CoTaP: Compliant Task Pipeline and Reinforcement Learning of Its Controller with Compliance Modulation},
author = {Zewen He and Chenyuan Chen and Dilshod Azizov and Yoshihiko Nakamura},
journal= {arXiv preprint arXiv:2509.25443},
year = {2025}
}
备注
Submitted to IEEE for possible publication, under review