中文

神经价值迭代

人工智能 2026-03-17 v3

摘要

POMDP的值函数具有分段线性凸(PWLC)特性,可表示为有限个超平面,称为α\alpha-向量。目前大多数先进POMDP求解器(离线规划器)遵循基于点的价值迭代方案,对α\alpha-向量在可达信念点上的Bellman备份直至收敛。然而,由于每个α\alpha-向量为S|S|维,随问题规模扩大,这些方法因Bellman备份的计算成本而变得不可行。在本工作中,我们展示PWLC特性允许POMDP的值函数可被替代地表示为有限个神经网络的集合。这一洞察使我们能够提出一种新的POMDP规划算法,称为“神经价值迭代”(Neural Value Iteration),将神经网络的泛化能力与经典价值迭代框架相结合。我们的ethods在极大规模POMDP中实现接近最优解,而现有离线求解器难以处理。

关键词

引用

@article{arxiv.2511.08825,
  title  = {Neural Value Iteration},
  author = {Yang You and Ufuk Çakır and Alex Schutz and Nick Hawes},
  journal= {arXiv preprint arXiv:2511.08825},
  year   = {2026}
}