从相对熵到极小极大:MDP中覆盖的统一框架
机器学习
2026-01-21 v1
摘要
在无奖励马尔可夫决策过程(MDP)中,对状态-动作对进行有针对性和有意识的探索至关重要。更准确地说,不同的状态-动作对表现出不同程度的重要性或难度,这必须主动且明确地纳入受控探索策略中。为此,我们提出了一族加权的、参数化的凹覆盖目标,记为,它直接定义在状态-动作占据测度上。这一族目标在一个单一框架内统一了几个被广泛研究的目标,包括基于散度的边缘匹配、加权平均覆盖和最坏情况(极小极大)覆盖。的凹性捕捉了与过度探索相关的收益递减,而梯度的简单闭式形式则能够实现明确的控制,以优先考虑探索不足的状态-动作对。利用这种结构,我们开发了一种基于梯度的算法,该算法主动引导诱导占据测度朝向期望的覆盖模式。此外,我们表明,随着的增加,所产生的探索策略越来越强调探索最少的状态-动作对,在极限情况下恢复最坏情况的覆盖行为。
引用
@article{arxiv.2601.11890,
title = {From Relative Entropy to Minimax: A Unified Framework for Coverage in MDPs},
author = {Xihe Gu and Urbashi Mitra and Tara Javidi},
journal= {arXiv preprint arXiv:2601.11890},
year = {2026}
}