中文

面向离政策学习的图形化状态变量选择方法

统计方法学 2025-01-03 v1 机器学习

摘要

序列决策问题在科学的多个领域都得到了广泛研究。当学习来自历史数据的政策时——一种常称为离政策学习的实践——一个关键挑战是如何在观察数据非随机化时“识别”政策影响。离政策学习主要在两种设置中进行研究:动态处理方案(DTRs),其中关注在具有短决策时域的医疗问题中控制混淆;以及离线强化学习(RL),其中关注在诸如游戏等封闭系统中的维度简化。两者这两个广受关注的设置之间的差距限制了离政策学习在许多实际问题中的更广泛应用。利用基于无环有向混合图(ADMGs)的因果推断理论,我们提供了涵盖 DTRs 和 MDP 的一般决策过程的图形识别准则。我们讨论了这些结果与 DTR 和 RL 文献中所作的隐式因果假设的关系,并进一步澄清了一些常见的误解。最后,我们呈现了一个针对容器物流中动态定价问题的真实仿真研究,表明违反图形准则会导致次优政策。

关键词

引用

@article{arxiv.2501.00854,
  title  = {A Graphical Approach to State Variable Selection in Off-policy Learning},
  author = {Joakim Blach Andersen and Qingyuan Zhao},
  journal= {arXiv preprint arXiv:2501.00854},
  year   = {2025}
}

备注

25 pages (not including appendix and references), 10 figures, 2 tables