奖励无关与奖励自由探索的改进界限
机器学习
2026-05-18 v2
摘要
我们研究奖励自由和奖励无关在有限时段马尔可夫决策过程(MDP)中的探索,其中代理人在不观察外部奖励的情况下探索未知环境。奖励自由探索旨在实现对任何在探索后揭示的奖励的 最优策略,而奖励无关探索则针对从小有限类中抽取的奖励实现 最优性。在奖励无关设置下,Li、Yan、Chen 和 Fan 达到了 minimax 样本复杂度,但仅适用于限制性小的准确度参数 。我们提出了一种新算法,显著放宽了对 的要求。我们的方法本身具有新颖且在技术上具有兴趣。我们的算法采用精心设计的奖励来构建在线学习过程,以构造一个探索策略,用于收集足够准确动态估计的数据,并在奖励揭示后计算出 最优策略。最后,我们为奖励自由探索建立了一个紧下界,弥合了已知上界和下界之间的差距。
引用
@article{arxiv.2602.16363,
title = {Improved Bounds for Reward-Agnostic and Reward-Free Exploration},
author = {Oran Ridel and Alon Cohen},
journal= {arXiv preprint arXiv:2602.16363},
year = {2026}
}