中文

反事实强化学习:如何建模预见未来的决策者

多智能体系统 2012-07-05 v1 计算机科学与博弈论

摘要

本文提出了一种新颖的框架,用于在多阶段博弈中对交互的人类进行建模。这种“迭代半网络形式博弈”框架具有以下理想特性:(1)有限理性参与者;(2)策略性参与者(即参与者在预测彼此行为时会考虑对方的奖励函数);(3)即使在真实世界系统上也具有计算可处理性。我们通过结合博弈论和强化学习的概念实现了这些优势。具体而言,我们将有限理性的“k级推理”模型扩展到适用于多阶段博弈。我们的扩展允许将整体建模问题分解为一系列较小的问题,每个问题都可以通过标准强化学习算法求解。我们将这种混合方法称为“k级强化学习”。我们在智能电网上的网络战场景中研究了这些想法,并讨论了模型预测的行为与真实人类防御者和攻击者可能表现出的行为之间的关系。

关键词

引用

@article{arxiv.1207.0852,
  title  = {Counter-Factual Reinforcement Learning: How to Model Decision-Makers That Anticipate The Future},
  author = {Ritchie Lee and David H. Wolpert and James Bono and Scott Backhaus and Russell Bent and Brendan Tracey},
  journal= {arXiv preprint arXiv:1207.0852},
  year   = {2012}
}

备注

Decision Making with Multiple Imperfect Decision Makers; Springer. 29 Pages, 6 Figures