中文

基于深度神经网络的低维流形上双稳健离屏策略学习

机器学习 2020-11-04 v1 机器学习

摘要

因果推断探究在协变量集上行动与随之产生的奖励之间的因果关系。近来深度学习在因果推断中取得了显著表现,但现有统计理论无法很好地解释这一经验性成功,尤其在协变量为高维时。因果推断中的多数理论结果都是渐近的,受维数灾难困扰,且只适用于有限行动场景。为弥合理论与实践的这一鸿沟,本文研究基于深度神经网络的双稳健离屏策略学习。当协变量位于低维流形上时,我们证明了非渐近后悔界,其以依赖于流形内在维数的快速率收敛。我们的结果涵盖有限行动与连续行动两种场景。我们的理论表明深度神经网络能自适应协变量的低维几何结构,并部分解释了深度学习在因果推断中的成功。

关键词

引用

@article{arxiv.2011.01797,
  title  = {Doubly Robust Off-Policy Learning on Low-Dimensional Manifolds by Deep Neural Networks},
  author = {Minshuo Chen and Hao Liu and Wenjing Liao and Tuo Zhao},
  journal= {arXiv preprint arXiv:2011.01797},
  year   = {2020}
}