中文

面向策略泛化的效应不变机制

机器学习 2023-06-28 v2 机器学习

摘要

策略学习是许多现实世界学习系统的重要组成部分。策略学习中的一个主要挑战是如何高效适应未见环境或任务。最近,有人建议利用不变条件分布来学习能更好泛化到未见环境的模型。然而,假设整个条件分布的不变性(我们称之为完全不变性)在实践中可能过于强。本文引入了一种对完全不变性的放宽,称为效应不变性(简称e-不变性),并证明在适当假设下,它足以实现零样本策略泛化。我们还讨论了一种扩展,当我们有来自测试环境的小样本时利用e-不变性,从而实现少样本策略泛化。我们的工作不假设底层因果图或数据由结构因果模型生成;相反,我们开发了直接从数据检验e-不变性的检验过程。我们使用模拟数据和移动健康干预数据集给出了实证结果,以证明我们方法的有效性。

关键词

引用

@article{arxiv.2306.10983,
  title  = {Effect-Invariant Mechanisms for Policy Generalization},
  author = {Sorawit Saengkyongam and Niklas Pfister and Predrag Klasnja and Susan Murphy and Jonas Peters},
  journal= {arXiv preprint arXiv:2306.10983},
  year   = {2023}
}