中文

利用因子化动作空间进行离屏策略评估

机器学习 2023-07-17 v1 人工智能 机器学习

摘要

离屏策略评估(OPE)旨在给定从已执行动作序列收集的数据时,估计遵循反事实动作序列的收益。然而,现有 OPE 估计器在涉及大型组合动作空间的问题中常表现出高偏差与高方差。我们研究如何利用因子化动作空间——即把每个动作表达为来自较小动作空间的独立子动作的组合——来缓解此问题。该方法促进了对动作效果差异的更细粒度分析。在本工作中,我们提出基于因子化动作空间的新一类“分解”重要性采样(IS)估计器。在对底层问题结构给定某些假设下,我们证明分解 IS 估计器比其原始未分解版本具有更小方差,同时保持零偏差性质。通过仿真,我们从经验上验证了理论结果,探查了各类假设的有效性。在提供能为给定问题推导动作空间因子化的技术后,我们的工作表明 OPE 可借由利用此固有问题结构而“免费”得到改善。

关键词

引用

@article{arxiv.2307.07014,
  title  = {Leveraging Factored Action Spaces for Off-Policy Evaluation},
  author = {Aaman Rebello and Shengpu Tang and Jenna Wiens and Sonali Parbhoo},
  journal= {arXiv preprint arXiv:2307.07014},
  year   = {2023}
}

备注

Main paper: 8 pages, 7 figures. Appendix: 30 pages, 17 figures. Accepted at ICML 2023 Workshop on Counterfactuals in Minds and Machines, Honolulu, Hawaii, USA. Camera ready version