中文

基于观测器的逆强化学习的飞行员性能建模

系统与控制 2023-07-26 v1 系统与控制 最优化与控制

摘要

本文关注无人机飞行员的行为建模。假设飞行员做出优化未知代价泛函的决策,该泛函利用一种新颖的逆强化学习(IRL)框架从观测轨迹中估计。由此产生的 IRL 问题通常存在多个解。本文中,一种近期提出的新型 IRL 观测器被适配于飞行员建模问题。该观测器被证明可收敛到 IRL 问题的等价解之一。所开发的技术在一架四旋翼飞行器上实现,其中飞行员为一个线性二次监督控制器,生成速度指令使四旋翼飞向并悬停在期望位置。实验结果证明了该方法的鲁棒性及其学习等价代价泛函的能力。

关键词

引用

@article{arxiv.2307.13150,
  title  = {Pilot Performance modeling via observer-based inverse reinforcement learning},
  author = {Jared Town and Zachary Morrison and Rushikesh Kamalapurkar},
  journal= {arXiv preprint arXiv:2307.13150},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2210.16299