基于观测器的逆强化学习的飞行员性能建模
系统与控制
2023-07-26 v1 系统与控制
最优化与控制
摘要
本文关注无人机飞行员的行为建模。假设飞行员做出优化未知代价泛函的决策,该泛函利用一种新颖的逆强化学习(IRL)框架从观测轨迹中估计。由此产生的 IRL 问题通常存在多个解。本文中,一种近期提出的新型 IRL 观测器被适配于飞行员建模问题。该观测器被证明可收敛到 IRL 问题的等价解之一。所开发的技术在一架四旋翼飞行器上实现,其中飞行员为一个线性二次监督控制器,生成速度指令使四旋翼飞向并悬停在期望位置。实验结果证明了该方法的鲁棒性及其学习等价代价泛函的能力。
引用
@article{arxiv.2307.13150,
title = {Pilot Performance modeling via observer-based inverse reinforcement learning},
author = {Jared Town and Zachary Morrison and Rushikesh Kamalapurkar},
journal= {arXiv preprint arXiv:2307.13150},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2210.16299