中文

从相对熵到极小极大:MDP中覆盖的统一框架

机器学习 2026-01-21 v1

摘要

在无奖励马尔可夫决策过程(MDP)中,对状态-动作对进行有针对性和有意识的探索至关重要。更准确地说,不同的状态-动作对表现出不同程度的重要性或难度,这必须主动且明确地纳入受控探索策略中。为此,我们提出了一族加权的、参数化的凹覆盖目标,记为UρU_\rho,它直接定义在状态-动作占据测度上。这一族目标在一个单一框架内统一了几个被广泛研究的目标,包括基于散度的边缘匹配、加权平均覆盖和最坏情况(极小极大)覆盖。UρU_\rho的凹性捕捉了与过度探索相关的收益递减,而UρU_\rho梯度的简单闭式形式则能够实现明确的控制,以优先考虑探索不足的状态-动作对。利用这种结构,我们开发了一种基于梯度的算法,该算法主动引导诱导占据测度朝向期望的覆盖模式。此外,我们表明,随着ρ\rho的增加,所产生的探索策略越来越强调探索最少的状态-动作对,在极限情况下恢复最坏情况的覆盖行为。

关键词

引用

@article{arxiv.2601.11890,
  title  = {From Relative Entropy to Minimax: A Unified Framework for Coverage in MDPs},
  author = {Xihe Gu and Urbashi Mitra and Tara Javidi},
  journal= {arXiv preprint arXiv:2601.11890},
  year   = {2026}
}