基于强化学习的氦气球资源受限定点保持
机器人学
2023-03-03 v1 人工智能
机器学习
摘要
高空气球已被证明可用于生态航测、大气监测和通信中继。然而,由于重量和功率限制,有必要研究平流层航行的替代推进方式。最近,强化学习被提出作为一种控制方案,利用不同高度上多样且相反的风场将气球维持在固定位置区域。尽管基于气泵的定点保持已被探索,但针对排气与压载驱动气球(常作为低成本替代方案)的控制问题尚无研究。我们展示了强化学习如何用于此类气球。具体而言,我们使用软 actor-critic 算法,平均能在 25% 的飞行时间内将位置保持在 50 km 以内,与当前最优水平一致。此外,我们表明所提出的控制器有效最小化了资源消耗,从而支持长航时飞行。我们将控制器构建为连续控制强化学习问题,相较于使用离散动作空间的当前最优工作,这允许更丰富的轨迹范围。进而,通过连续控制,我们可以利用气泵无法实现的更大上升速率。期望上升速率被解耦为期望高度和时间因子,以提供比以往工作所用的底层控制指令更透明的策略。最后,通过应用运动方程,我们确立了排气与压载的适当阈值以防止智能体利用环境。更具体地,我们通过施加排气与压载约束来确保动作在物理上可行。
引用
@article{arxiv.2303.01173,
title = {Resource-Constrained Station-Keeping for Helium Balloons using Reinforcement Learning},
author = {Jack Saunders and Loïc Prenevost and Özgür Şimşek and Alan Hunter and Wenbin Li},
journal= {arXiv preprint arXiv:2303.01173},
year = {2023}
}