$\kappa$-Explorer:面向 MDP 中主动模型估计的统一框架
机器学习
2026-02-25 v1
摘要
在表格形式的马尔可夫决策过程 (MDP) 中且具有完美的状态可观测性时,每条轨迹都提供来自以状态-动作对为条件的转换分布的主动样本。因此,准确的模型估计取决于探索策略如何分配访问频率,以适应每种转换分布的内在复杂度。建立在最近的覆盖率基于探索工作基础上,我们引入一族参数化的可分解且凹的目标函数 ,显式地融合了内在估计复杂度和外在访问频率。此外,曲率 提供了对各种全局目标(如平均情况和最坏情况估计误差目标)的统一处理。利用 梯度的闭式表征,我们提出了 -Explorer,一种基于 Frank-Wolfe 风格优化对状态-动作占用率措施的主动探索算法。 的递减性质自然优先考虑 underexplored 和高方差的转换,同时保持平滑性质,使其能够高效优化。我们为 -Explorer 建立了紧密的后悔保证,并进一步引入一个完全在线且计算高效的替代算法用于实际应用。基准 MDP 上的实验表明,-Explorer 在现有探索策略方面提供了优异的性能。
引用
@article{arxiv.2602.20404,
title = {$\kappa$-Explorer: A Unified Framework for Active Model Estimation in MDPs},
author = {Xihe Gu and Urbashi Mitra and Tara Javidi},
journal= {arXiv preprint arXiv:2602.20404},
year = {2026}
}