具有潜在内生性的基于工具变量的强化学习的渐近理论
机器学习
2024-12-25 v3 机器学习
计量经济学
最优化与控制
摘要
在标准数据分析框架中,数据被(一次性)收集,随后进行数据分析。然而,随着数字技术的进步,决策者不断分析过往数据并通过其决策生成新数据。我们将此建模为马尔可夫决策过程,并表明数据生成与数据分析之间的动态交互导致了一种新型偏差——强化偏差——其加剧了标准数据分析中的内生性问题。我们提出一类基于工具变量(IV)的强化学习(RL)算法以纠正该偏差,并通过将其纳入随机逼近(SA)框架来建立其理论性质。我们的分析兼容迭代依赖的马尔可夫结构,因此可用于研究带策略改进的RL算法。我们还提供了IV-RL算法最优策略推断的公式。这些公式凸显了马尔可夫环境的跨期依赖如何影响推断。
引用
@article{arxiv.2103.04021,
title = {Asymptotic Theory for IV-Based Reinforcement Learning with Potential Endogeneity},
author = {Jin Li and Ye Luo and Zigan Wang and Xiaowei Zhang},
journal= {arXiv preprint arXiv:2103.04021},
year = {2024}
}
备注
main body: 42 pages; supplemental material: 14 pages