论信息结构在部分可观测序列团队与博弈强化学习中的作用
机器学习
2024-05-29 v2 人工智能
机器学习
摘要
在序列决策问题中,信息结构描述了系统中不同时间点发生的事件如何相互影响。经典的强化学习模型(如 MDP、POMDP)假设一种简单且高度规则的信息结构,而预测状态表示等更一般的模型则未对信息结构进行显式建模。相比之下,现实世界的序列决策问题通常涉及系统变量间复杂且随时间变化的相互依赖关系,需要信息结构的丰富且灵活的表示。在本文中,我们形式化了一种显式表示信息结构的新颖强化学习模型。随后,我们利用该模型对一般序列决策问题的统计难度进行了信息结构分析,通过信息结构 DAG 表示的图论量获得了其特征刻画。我们通过展示一种达到上界的算法,证明了学习一般序列决策问题的样本复杂度关于其信息结构的上界。这恢复了已知的易处理性结果,并为一般序列决策问题中的强化学习提供了新视角,提供了一种识别新的易处理问题类的系统方法。
引用
@article{arxiv.2403.00993,
title = {On the Role of Information Structure in Reinforcement Learning for Partially-Observable Sequential Teams and Games},
author = {Awni Altabaa and Zhuoran Yang},
journal= {arXiv preprint arXiv:2403.00993},
year = {2024}
}
备注
59 pages, 5 figures