神经价值迭代
人工智能
2026-03-17 v3
摘要
POMDP的值函数具有分段线性凸(PWLC)特性,可表示为有限个超平面,称为-向量。目前大多数先进POMDP求解器(离线规划器)遵循基于点的价值迭代方案,对-向量在可达信念点上的Bellman备份直至收敛。然而,由于每个-向量为维,随问题规模扩大,这些方法因Bellman备份的计算成本而变得不可行。在本工作中,我们展示PWLC特性允许POMDP的值函数可被替代地表示为有限个神经网络的集合。这一洞察使我们能够提出一种新的POMDP规划算法,称为“神经价值迭代”(Neural Value Iteration),将神经网络的泛化能力与经典价值迭代框架相结合。我们的ethods在极大规模POMDP中实现接近最优解,而现有离线求解器难以处理。
关键词
引用
@article{arxiv.2511.08825,
title = {Neural Value Iteration},
author = {Yang You and Ufuk Çakır and Alex Schutz and Nick Hawes},
journal= {arXiv preprint arXiv:2511.08825},
year = {2026}
}