中文

奖励无关与奖励自由探索的改进界限

机器学习 2026-05-18 v2

摘要

我们研究奖励自由和奖励无关在有限时段马尔可夫决策过程(MDP)中的探索,其中代理人在不观察外部奖励的情况下探索未知环境。奖励自由探索旨在实现对任何在探索后揭示的奖励的 ϵ\epsilon 最优策略,而奖励无关探索则针对从小有限类中抽取的奖励实现 ϵ\epsilon 最优性。在奖励无关设置下,Li、Yan、Chen 和 Fan 达到了 minimax 样本复杂度,但仅适用于限制性小的准确度参数 ϵ\epsilon。我们提出了一种新算法,显著放宽了对 ϵ\epsilon 的要求。我们的方法本身具有新颖且在技术上具有兴趣。我们的算法采用精心设计的奖励来构建在线学习过程,以构造一个探索策略,用于收集足够准确动态估计的数据,并在奖励揭示后计算出 ϵ\epsilon 最优策略。最后,我们为奖励自由探索建立了一个紧下界,弥合了已知上界和下界之间的差距。

关键词

引用

@article{arxiv.2602.16363,
  title  = {Improved Bounds for Reward-Agnostic and Reward-Free Exploration},
  author = {Oran Ridel and Alon Cohen},
  journal= {arXiv preprint arXiv:2602.16363},
  year   = {2026}
}