探究观察空间设计选择对太空船问题强化学习解决方案训练的影响
机器学习
2025-01-13 v1 系统与控制
系统与控制
摘要
最近的研究表明,使用强化学习 (RL) 来学习航天器操作的自主控制取得了很大成功。然而,最近的一项研究表明,通过更改学习环境中使用的动作空间,即控制输出,可以提高其性能。这为通过进一步更改环境中的内容寻找更多改进的机会打开了大门。本文的工作聚焦于如何更改环境的观察空间对学习航天器检查任务的 RL 代理训练和性能的影响。该研究分为两个部分。第一部分考察了旨在帮助代理人学习任务的传感器的影响。第二部分考察了参考系的影响,通过重新定向代理人以从不同视角观察世界。结果表明,传感器并非必要,但大多数传感器有助于代理人学习更优化的行为;参考系的影响不大,但保持一致性最佳。
引用
@article{arxiv.2501.06016,
title = {Investigating the Impact of Observation Space Design Choices On Training Reinforcement Learning Solutions for Spacecraft Problems},
author = {Nathaniel Hamilton and Kyle Dunlap and Kerianne L Hobbs},
journal= {arXiv preprint arXiv:2501.06016},
year = {2025}
}
备注
18 pages, 10 figures, 3 tables