结构因果 bandits 的可传递性
机器学习
2025-11-25 v1 机器学习
摘要
拥有因果知识的智能代理可以优化其行动空间以避免不必要的探索。结构因果 bandit 框架提供了用于识别无法最大化奖励的动作的图形化表述,利用底层因果结构的先验知识。虽然这种知识使代理能够基于其他动作在在线交互中估计某些动作的预期奖励,但对于如何从不同条件下(观察或实验)收集的任意数据组合以及来自异构环境的信息进行传递几乎没有指导。本文我们研究具有可传递性的结构因果 bandit,其中来自源环境的先验被融合以增强部署设置中的学习。我们展示了可以利用跨环境的不变性来持续性地改进学习。 resulting bandit algorithm achieves a sub-linear regret bound with an explicit dependence on informativeness of prior data, and it may outperform standard bandit approaches that rely solely on online learning.
引用
@article{arxiv.2511.17953,
title = {On Transportability for Structural Causal Bandits},
author = {Min Woo Park and Sanghack Lee},
journal= {arXiv preprint arXiv:2511.17953},
year = {2025}
}