中文

无需滚动的 Maximum Entropy 探索

机器学习 2026-03-16 v1 人工智能

摘要

高效探索仍是强化学习中的核心挑战,作为数据收集的有用预训练目标,尤其在外部奖励函数不可用时。探索问题的原则性表述是寻找最大化其诱导稳态访问分布熵的策略,从而鼓励状态空间的均匀长期覆盖。许多现有探索方法需要通过重复的 on-policy 滚动来估计状态访问频率,这可能计算成本较高。在本工作中,我们考虑一种内在平均奖励表述,其中奖励来自访问分布本身,以便最优策略最大化稳态熵。对该目标的熵正则化版本可采用谱特征来表述:相关稳态分布可从问题相关的转移矩阵的主特征向量中计算。此洞察导致了一种新的求解最大熵探索问题的算法,EVE(EigenVector-based Exploration),它避免了显式的滚动和分布估计,改为通过迭代更新来求解,类似于基于价值的方法。为解决原始未正则化目标,我们采用后验策略迭代 (PPI) 方法,该方法单调提高熵并在值上收敛。我们在标准假设下证明了 EVE 的收敛,并通过实证演示表明它有效地产生具有高稳态熵的策略,在确定性网格世界环境中实现了与滚动基于基线相当的探索性能。

关键词

引用

@article{arxiv.2603.12325,
  title  = {Maximum Entropy Exploration Without the Rollouts},
  author = {Jacob Adamczyk and Adam Kamoski and Rahul V. Kulkarni},
  journal= {arXiv preprint arXiv:2603.12325},
  year   = {2026}
}