基于混合内在奖励模型的深度强化学习
系统与控制
2025-01-23 v1 系统与控制
动力系统
摘要
内在奖励塑形已成为解决强化学习(RL)中困难探索和稀疏奖励环境的流行方法。虽然单一内在奖励(如好奇心驱动或新颖性方法)显示出有效性,但它们往往限制了探索的多样性和效率。此外,探索多个内在奖励的潜力和原则仍不充分。为此,我们引入了 HIRE(Hybrid Intrinsic REward),一个灵活且优雅的框架,通过精心设计的融合策略创建混合内在奖励。通过 HIRE,我们对混合内在奖励在通用和无监督 RL 中的应用进行了系统性分析。广泛的实验表明,HIRE 可以显著提升复杂动态环境中的探索效率和多样性,以及技能获取。
引用
@article{arxiv.2501.12626,
title = {The Intrinsic State Variable in Fundamental Lemma and Its Use in Stability Design for Data-based Control},
author = {Yitao Yan and Jie Bao and Biao Huang},
journal= {arXiv preprint arXiv:2501.12626},
year = {2025}
}