中文

部分 $q^{\pi}$-可实现性下强化学习的计算困难性

人工智能 2025-10-31 v1 计算复杂性 机器学习

摘要

本文探讨了在一种新型线性函数逼近 regime 下的强化学习计算复杂度,称为部分 qπq^{\pi}-可实现性。在此框架中,目标是在预定义的策略集合 Π\Pi 下学习一个 ϵ\epsilon-最优策略,假设集合 Π\Pi 中所有策略的值函数都可线性实现。该框架的假设条件比 qπq^{\pi}-可实现性弱,但比 qq^*-可实现性强,提供了一个实际模型,其中函数逼近自然出现。我们证明,在此设置下学习 ϵ\epsilon-最优策略是计算困难的。具体而言,我们在参数化贪心策略集合(argmax)下建立了NP难度,并指出除非 NP = RP,否则当策略集合包含softmax策略时,特征向量维度上的指数下界在Randomized Exponential Time Hypothesis下成立。我们的 hardness 结果类似于 qq^*-可实现性,表明即使在 Π\Pi 超越最优策略后,计算难度仍然存在。为建立此结果,我们将 δ\delta-Max-3SAT 和 δ\delta-Max-3SAT(b) 从 GLinear-κ\kappa-RL(贪心策略)和 SLinear-κ\kappa-RL(softmax策略)实例中归约。我们的发现表明,部分 qπq^{\pi}-可实现性下通常无法获得正面的计算结果,与 qπq^{\pi}-可实现性在生成式访问模型下的 qπq^{\pi}-可实现性形成对比。

关键词

引用

@article{arxiv.2510.21888,
  title  = {Computational Hardness of Reinforcement Learning with Partial $q^{\pi}$-Realizability},
  author = {Shayan Karimi and Xiaoqi Tan},
  journal= {arXiv preprint arXiv:2510.21888},
  year   = {2025}
}

备注

to be published in NeurIPS 2025