部分 $q^{\pi}$-可实现性下强化学习的计算困难性
人工智能
2025-10-31 v1 计算复杂性
机器学习
摘要
本文探讨了在一种新型线性函数逼近 regime 下的强化学习计算复杂度,称为部分 -可实现性。在此框架中,目标是在预定义的策略集合 下学习一个 -最优策略,假设集合 中所有策略的值函数都可线性实现。该框架的假设条件比 -可实现性弱,但比 -可实现性强,提供了一个实际模型,其中函数逼近自然出现。我们证明,在此设置下学习 -最优策略是计算困难的。具体而言,我们在参数化贪心策略集合(argmax)下建立了NP难度,并指出除非 NP = RP,否则当策略集合包含softmax策略时,特征向量维度上的指数下界在Randomized Exponential Time Hypothesis下成立。我们的 hardness 结果类似于 -可实现性,表明即使在 超越最优策略后,计算难度仍然存在。为建立此结果,我们将 -Max-3SAT 和 -Max-3SAT(b) 从 GLinear--RL(贪心策略)和 SLinear--RL(softmax策略)实例中归约。我们的发现表明,部分 -可实现性下通常无法获得正面的计算结果,与 -可实现性在生成式访问模型下的 -可实现性形成对比。
引用
@article{arxiv.2510.21888,
title = {Computational Hardness of Reinforcement Learning with Partial $q^{\pi}$-Realizability},
author = {Shayan Karimi and Xiaoqi Tan},
journal= {arXiv preprint arXiv:2510.21888},
year = {2025}
}
备注
to be published in NeurIPS 2025