中文

在轨迹优化与策略学习间强制共识以实现精确机器人控制

机器人学 2023-02-17 v3 机器学习

摘要

强化学习(RL)与轨迹优化(TO)具有显著的互补优势。一方面,RL 方法能够直接从数据中学习全局控制策略,但通常需大量样本才能恰当收敛至可行策略。另一方面,TO 方法能够利用从仿真器提取的基于梯度的信息,快速收敛至仅在该解邻域内有效的局部最优控制轨迹。过去十年中,若干方法致力于将这两类方法恰当结合以兼得二者之长。沿用此研究脉络,我们在现有方法基础上提出若干改进,以更快学习全局控制策略,特别是通过 Sobolev 学习利用源自 TO 方法的灵敏度信息,以及采用增广拉格朗日技术来强制 TO 与策略学习间的共识。我们通过在机器人学各类经典任务上与文献现有方法比较,评估了这些改进的益处。

关键词

引用

@article{arxiv.2209.09006,
  title  = {Enforcing the consensus between Trajectory Optimization and Policy Learning for precise robot control},
  author = {Quentin Le Lidec and Wilson Jallet and Ivan Laptev and Cordelia Schmid and Justin Carpentier},
  journal= {arXiv preprint arXiv:2209.09006},
  year   = {2023}
}