中文

ELEMENT:基于最大熵的episodic与终身探索

机器学习 2024-12-06 v1 人工智能

摘要

本文提出了一种名为Episodic and Lifelong Exploration via Maximum ENTropy(ELEMENT)的新型、多尺度的、内在动机的强化学习(RL)框架,能够在不使用任何外部奖励的情况下探索环境,并有效地将所学技能迁移到下游任务。我们以三方面推进了现有技术。首先,我们提出了多尺度熵优化,以解决以往最大状态熵在终身探索中面临奖励消失和跨迭代计算昂贵的问题,因此我们在每个episode中添加最大化熵以加速搜索。其次,我们提出了一种用于episodic熵最大化的新型内在奖励,称为average episodic state entropy(平均episodic状态熵),它为episodic状态熵目标的理论上界提供了最优解。最后,为加速终身熵最大化,我们提出一种k近邻(kNN)图来组织熵估计和更新过程,从而大幅降低计算量。我们的ELEMENT在episodic和终身setup中均显著优于现有的内在奖励方法。此外,它可被用于任务无关的预训练、收集离线强化学习数据等。

关键词

引用

@article{arxiv.2412.03800,
  title  = {ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy},
  author = {Hongming Li and Shujian Yu and Bin Liu and Jose C. Principe},
  journal= {arXiv preprint arXiv:2412.03800},
  year   = {2024}
}