面向 Dec-POMDP 的风险寻求保守策略迭代及基于智能体状态的策略
多智能体系统
2026-04-13 v1
摘要
最优求解以 Dec-POMDP 模型表示的分布式决策问题已知为 NEXP-complete。这些最优解是基于智能体整个观察和动作历史的策略。然而,某些应用可能需要更紧凑的策略,因为计算资源有限,这可以通过考虑有限数量的记忆状态(或智能体状态)来建模。虽然此类基于智能体状态的策略类别可能不包含最优解,但仍然值得在该类别中寻找最佳基于智能体状态的策略。我们关注一种迭代最佳响应风格的算法,保证在 Dec-POMDP 模型规模的多项式运行时间内实现单调改进并收敛到局部最优解。为了获得更好的局部最优解,我们使用修改后的目标函数,以鼓励风险寻求和保守策略迭代更新。我们的实验结果表明,该方法在几个 Dec-POMDP 基准测试上表现与最先进的方法相当,在有限记忆条件下仍实现接近最优的性能。我们还展示了使用更多智能体状态(更大的记忆)会导致更好的性能。我们的做法为在 Dec-POMDP 问题中对智能体的记忆约束提供了一种新方法。
引用
@article{arxiv.2604.09495,
title = {Risk-seeking conservative policy iteration with agent-state based policies for Dec-POMDPs with guaranteed convergence},
author = {Amit Sinha and Matthieu Geist and Aditya Mahajan},
journal= {arXiv preprint arXiv:2604.09495},
year = {2026}
}