强化学习中的转移前瞻难度分析
机器学习
2026-03-31 v2 机器学习
摘要
我们研究了强化学习(RL)中的转移前瞻问题,即在决定行动方案之前,智能体可以观察执行任意长度为 步动作序列后将访问的状态。尽管这种预测信息可以显著提高可实现的性能,但我们证明了最优地使用这一信息的计算成本可能相当高昂。具体而言,我们证明了对于一步前瞻()的最优规划可以通过一种新颖的线性规划公式在多项式时间内求解。相比之下,当 时,问题变得NP难。我们的结果描绘了强化学习中进行转移前瞻规划问题在可计算性与不可计算性之间确切的边界。
引用
@article{arxiv.2510.19372,
title = {On the Hardness of Reinforcement Learning with Transition Look-Ahead},
author = {Corentin Pla and Hugo Richard and Marc Abeille and Nadav Merlis and Vianney Perchet},
journal= {arXiv preprint arXiv:2510.19372},
year = {2026}
}