面向策略泛化的效应不变机制
机器学习
2023-06-28 v2 机器学习
摘要
策略学习是许多现实世界学习系统的重要组成部分。策略学习中的一个主要挑战是如何高效适应未见环境或任务。最近,有人建议利用不变条件分布来学习能更好泛化到未见环境的模型。然而,假设整个条件分布的不变性(我们称之为完全不变性)在实践中可能过于强。本文引入了一种对完全不变性的放宽,称为效应不变性(简称e-不变性),并证明在适当假设下,它足以实现零样本策略泛化。我们还讨论了一种扩展,当我们有来自测试环境的小样本时利用e-不变性,从而实现少样本策略泛化。我们的工作不假设底层因果图或数据由结构因果模型生成;相反,我们开发了直接从数据检验e-不变性的检验过程。我们使用模拟数据和移动健康干预数据集给出了实证结果,以证明我们方法的有效性。
引用
@article{arxiv.2306.10983,
title = {Effect-Invariant Mechanisms for Policy Generalization},
author = {Sorawit Saengkyongam and Niklas Pfister and Predrag Klasnja and Susan Murphy and Jonas Peters},
journal= {arXiv preprint arXiv:2306.10983},
year = {2023}
}