Grain of Truth 问题的一个形式化解
人工智能
2016-09-21 v1 计算机科学与博弈论
机器学习
摘要
如果贝叶斯智能体的先验概率对多智能体环境中的其他智能体策略分配了正概率(换言之,其先验包含一粒真实(grain of truth)),则该智能体能够学会预测其他智能体的策略。寻找一个包含相对于自身的贝叶斯最优策略的合理大小的策略类,被称为 grain of truth 问题。目前已知仅有极少数类别具有 grain of truth,且文献中包含若干相关的不可能性结果。在本文中,我们给出了完整 grain of truth 问题的一个形式化且通用的解:我们构造了一个策略类,它包含所有可计算策略,以及针对该类上每个下半可计算先验的贝叶斯最优策略。当环境未知时,贝叶斯最优智能体即使渐近地也可能无法采取最优行动。然而,基于 Thompson sampling 的智能体在任意未知可计算多智能体环境中会收敛至博弈 {\epsilon}-Nash 均衡。尽管这些结果纯粹是理论上的,我们证明了它们可以在计算上被任意逼近。
引用
@article{arxiv.1609.05058,
title = {A Formal Solution to the Grain of Truth Problem},
author = {Jan Leike and Jessica Taylor and Benya Fallenstein},
journal= {arXiv preprint arXiv:1609.05058},
year = {2016}
}
备注
UAI 2016