中文

基于混合内在奖励模型的深度强化学习

系统与控制 2025-01-23 v1 系统与控制 动力系统

摘要

内在奖励塑形已成为解决强化学习(RL)中困难探索和稀疏奖励环境的流行方法。虽然单一内在奖励(如好奇心驱动或新颖性方法)显示出有效性,但它们往往限制了探索的多样性和效率。此外,探索多个内在奖励的潜力和原则仍不充分。为此,我们引入了 HIRE(Hybrid Intrinsic REward),一个灵活且优雅的框架,通过精心设计的融合策略创建混合内在奖励。通过 HIRE,我们对混合内在奖励在通用和无监督 RL 中的应用进行了系统性分析。广泛的实验表明,HIRE 可以显著提升复杂动态环境中的探索效率和多样性,以及技能获取。

关键词

引用

@article{arxiv.2501.12626,
  title  = {The Intrinsic State Variable in Fundamental Lemma and Its Use in Stability Design for Data-based Control},
  author = {Yitao Yan and Jie Bao and Biao Huang},
  journal= {arXiv preprint arXiv:2501.12626},
  year   = {2025}
}