信息不对称下的策略性决策:基于算法工具变量的可证明高效强化学习
机器学习
2022-08-24 v1 信息论
机器学习
math.IT
最优化与控制
统计方法学
摘要
我们研究一种称为策略性MDP(strategic MDP)的新模型下的离线强化学习,该模型刻画了委托人与一系列具有私有类型的短视代理人之间的策略性交互。由于双层结构和私有类型,策略性MDP涉及委托人与代理人之间的信息不对称。我们关注离线RL问题,其目标基于由历史交互组成的预收集数据集,学习委托人关于目标代理人总体的最优策略。未观测到的私有类型混淆了此类数据集,因为它们同时影响委托人获得的奖励与观测。我们提出一种新算法——基于算法工具变量的悲观策略学习(PLAN),该算法利用工具变量回归与悲观原则的思想,在一般函数逼近背景下学习近最优的委托人策略。我们的算法基于一个关键观察:委托人的动作充当有效的工具变量。特别地,在离线数据集的部分覆盖假设下,我们证明PLAN输出一个-最优策略,其中为收集到的轨迹数。我们进一步将我们的框架应用于策略性MDP的一些特例,包括策略性回归、策略性bandit以及推荐系统中的不依从。
引用
@article{arxiv.2208.11040,
title = {Strategic Decision-Making in the Presence of Information Asymmetry: Provably Efficient RL with Algorithmic Instruments},
author = {Mengxin Yu and Zhuoran Yang and Jianqing Fan},
journal= {arXiv preprint arXiv:2208.11040},
year = {2022}
}
备注
62 pages