适用于随机与不完全信息环境中决策的类Geiringer定理的一个版本
人工智能
2011-10-24 v1 离散数学
摘要
目的:近年来,诸如蒙特卡洛树搜索等蒙特卡洛采样方法在无模型强化学习中取得了巨大成功。将所谓的上置信界策略(用于保持“探索与利用”平衡以选择动作进行采样评估)与强大的计算能力(用于动态存储和更新一个相当大的预评估博弈树)相结合,催生了在9x9棋盘上击败顶尖人类围棋选手的软件。当前研究的许多努力致力于将蒙特卡洛采样方法的适用范围扩展到具有非即时回报的部分可观测马尔可夫决策过程。随机性和不完全信息带来的主要挑战在于,由于同一动作可能导致的回报存在巨大差异,需要在机会节点处处理动作评估。本文旨在建立一个定理的一个版本,该定理起源于群体遗传学,后来被进化计算理论采纳,它将导向能够可证明地提升人工智能潜力的新型蒙特卡洛采样算法。由于篇幅限制,实际算法本身将在后续论文中呈现,但本文为这类算法的开发提供了坚实的数学基础,并解释了它们为何如此有前景。
引用
@article{arxiv.1110.4657,
title = {A Version of Geiringer-like Theorem for Decision Making in the Environments with Randomness and Incomplete Information},
author = {Boris Mitavskiy and Jonathan Rowe and Chris Cannings},
journal= {arXiv preprint arXiv:1110.4657},
year = {2011}
}
备注
53 pages in size. This work has been recently submitted to the IJICC (International Journal on Intelligent Computing and Cybernetics)