中文

基于时间距离的剧集新奇性

机器学习 2025-01-28 v1 人工智能

摘要

稀疏奖励环境中的探索在强化学习中仍然是一个重大挑战,尤其是在上下文马尔可夫决策过程(CMDP)中,其中各剧集之间的环境不同。现有的 CMDP 剧集内驱动方法主要依赖基于计数的方法,这在大状态空间中无效,或依赖基于相似性的方法,而缺乏适当的状态比较指标。为解决这些问题,我们提出了基于时间距离的剧集新奇性(ETD),这是一种引入时间距离作为状态相似性和内在奖励计算的稳健指标的新方法。通过对比学习,ETD 准确估计时间距离并基于当前剧集中状态的新奇性派生内在奖励。广泛的基准任务实验表明,ETD 在各类基准任务上均显著优于最先进的方法,凸显了其在稀疏奖励 CMDP 中增强探索方面的有效性。

关键词

引用

@article{arxiv.2501.15418,
  title  = {Episodic Novelty Through Temporal Distance},
  author = {Yuhua Jiang and Qihan Liu and Yiqin Yang and Xiaoteng Ma and Dianyu Zhong and Hao Hu and Jun Yang and Bin Liang and Bo Xu and Chongjie Zhang and Qianchuan Zhao},
  journal= {arXiv preprint arXiv:2501.15418},
  year   = {2025}
}

备注

ICLR2025