基于深度强化学习的自适应控制器学习:从稀疏奖励到稠密奖励的跨层次迁移
太阳与恒星天体物理
2025-04-29 v1 星系天体物理
摘要
本文提出一种基于深度强化学习的自适应控制器学习方法,通过跨层次奖励迁移,将稀疏奖励信号转化为稠密奖励。我们首先定义了一个抽象的控制任务,将其分解为多个子任务,每个子任务都有明确的奖励信号。然后,我们开发了一种层次化奖励设计框架,能够自动从稀疏奖励中提取更丰富的学习信号。进一步地,我们提出了一种基于模型的奖励迁移机制,将低层次经验迁移到高层次决策中。实验结果表明,我们的方法在多个复杂控制任务上实现了显著的性能提升,尤其在面对稀疏奖励环境时,学习效率得到了显著的提高。
引用
@article{arxiv.2504.18088,
title = {Investigating open cluster King 6: Detection of three new variables},
author = {Vaibhav Kumar Pandey and Arvind K Dattatrey and Apara Tripathi and R K S Yadav and Shantanu Rastogi},
journal= {arXiv preprint arXiv:2504.18088},
year = {2025}
}
备注
There are 27 pages with 21 figures and 5 tables