通过因果可传递性进行带协变量漂移的潜在情境多臂老虎机的迁移学习
机器学习
2025-02-28 v1
摘要
将知识从一个环境转移到另一个环境是智能系统不可或缺的能力。然而,当两个环境不同时,盲目地转移所有知识可能会降低性能,这一现象被称为负迁移。本文从因果推断的角度来解决此问题,具体来说是在潜在情境多臂老虎机框架中进行迁移学习,其中实际情境是隐藏的,但可能存在高维代理。我们进一步考虑跨环境的协变量漂移。我们表明,在此设置下,对经典老虎机算法盲目转移所有知识会导致负迁移。随后,我们利用因果推断中的可传递性理论开发了算法,显式地转移用于估计目标环境中感兴趣因果效应的有效知识。此外,我们利用变分自编码器来近似目标环境下的因果效应。我们在合成数据和半合成数据上测试了这些算法,实证结果表明,与基线算法相比,我们的方法在不同代理下 consistently 实现更高的学习效率,展示了我们因果框架在知识转移方面的有效性。
引用
@article{arxiv.2502.20153,
title = {Transfer Learning in Latent Contextual Bandits with Covariate Shift Through Causal Transportability},
author = {Mingwei Deng and Ville Kyrki and Dominik Baumann},
journal= {arXiv preprint arXiv:2502.20153},
year = {2025}
}
备注
Accepted at the Conference of Causal Learning and Reasoning (CLeaR 2025), will be published in the Proceedings of Machine Learning Research