中文

基于最优策略和/或值函数深度表示的星际转移

神经与进化计算 2019-12-18 v1 人工智能 机器学习

摘要

近年来,基于深度网络的一些星际轨迹应用被相继提出。这些方法通常依赖于可从大量最优轨迹中学习的数据。本文引入一种新方法,可从单条标称轨迹快速生成数百万条最优航天器轨迹。除标称轨迹的生成外,无需求解额外的优化控制问题,因为所有轨迹按构造均满足庞特里亚金极小值原理及相应的横截条件。随后我们考虑深度前馈神经网络,并在所创建的数据集上对三种学习方法进行基准测试:策略模仿、值函数学习和值函数梯度学习。我们的结果针对从地球出发抵达金星轨道的星际轨迹优化问题给出。我们发现策略模仿与值函数梯度学习均能够学习到最优状态反馈,而在值函数学习情形下未能捕捉到最优策略,仅捕捉到最优推进剂质量的最终值。

关键词

引用

@article{arxiv.1904.08809,
  title  = {Interplanetary Transfers via Deep Representations of the Optimal Policy and/or of the Value Function},
  author = {Dario Izzo and Ekin Öztürk and Marcus Märtens},
  journal= {arXiv preprint arXiv:1904.08809},
  year   = {2019}
}