状态变量、Bandit 问题与 POMDP
机器学习
2020-02-18 v1 人工智能
机器学习
摘要
状态变量无疑是序贯决策问题中最微妙的维度。在主动学习问题("bandit 问题")的背景下尤其如此,其中决策影响我们所观测和学习的对象。我们描述了建模{\it 任意}序贯决策问题的规范框架,并给出状态变量的定义,使我们能够断言:任何被正确建模的序贯决策问题都是马尔可夫的。我们随后给出部分可观测马尔可夫决策问题(POMDPs)的一种新颖双智能体视角,使我们能够进而断言:任何真实决策问题的模型都是(可能)非马尔可夫的。我们利用人群中流感观测与治疗的背景阐明这些视角,并在该设定下给出全部四类策略的示例。最后我们指出了如何将这种思考扩展到多智能体问题。
引用
@article{arxiv.2002.06238,
title = {On State Variables, Bandit Problems and POMDPs},
author = {Warren B Powell},
journal= {arXiv preprint arXiv:2002.06238},
year = {2020}
}