中文

DOB-Net:主动抑制未知时变强扰动

机器人学 2020-01-30 v2 机器学习 系统与控制 系统与控制

摘要

本文提出一种观测器集成的强化学习(RL)方法,称为扰动观测器网络(DOB-Net),用于机器人在未知且时变、并可能频繁超出机器人控制能力的扰动环境中运行。DOB-Net集成了扰动动力学观测器网络与控制器网络。源于传统DOB机制,该观测器通过循环神经网络(RNNs)构建并增强,在RNN隐藏状态中编码未知扰动的过去值估计与未来值预测。这种编码使得控制器在机器人控制能力约束下生成最优控制信号以主动抑制扰动。观测器与控制器在策略优化中由优势 actor-critic 联合学习。位置调节任务的数值仿真表明,所提DOB-Net显著优于传统反馈控制器与经典RL算法。

关键词

引用

@article{arxiv.1907.04514,
  title  = {DOB-Net: Actively Rejecting Unknown Excessive Time-Varying Disturbances},
  author = {Tianming Wang and Wenjie Lu and Zheng Yan and Dikai Liu},
  journal= {arXiv preprint arXiv:1907.04514},
  year   = {2020}
}