基于 HSVI 的在线 Minimax 策略用于具备神经感知机制的部分可观测随机游戏
计算机科学与博弈论
2024-04-17 v1 人工智能
摘要
我们考虑一种带有神经感知机制和非对称信息结构的连续状态部分可观测随机游戏的变体。一个代理人拥有部分信息,其观察函数实现为神经网络,而另一个代理人被假设为拥有对状态的完整知识。我们提出了一种高效的在线方法,用于计算 -minimax 策略轮廓,该方法在每个阶段只需要求解一个线性规划,而不是复杂地估计对手的反事实价值。对于部分信息代理人,我们提出了一种持续解决方法,该方法使用较低的界限(通过启发式搜索价值迭代(HSVI)预计算),而不是使用对手的反事实价值。这继承了持续解决的可靠性,同时以预计算界限为代价。对于完全信息的代理人,我们提出了一种推断信念策略,其中该代理人基于 (离线) 来自 HSVI 的上界维护对部分信息代理人信念的推断信念,确保其与两个代理人在初始信念下已知的游戏价值之间相隔 。
关键词
引用
@article{arxiv.2404.10679,
title = {HSVI-based Online Minimax Strategies for Partially Observable Stochastic Games with Neural Perception Mechanisms},
author = {Rui Yan and Gabriel Santos and Gethin Norman and David Parker and Marta Kwiatkowska},
journal= {arXiv preprint arXiv:2404.10679},
year = {2024}
}
备注
12 pages, 2 figures