基于深度强化学习的摊销主动因果归纳
机器学习
2024-05-28 v1 人工智能
摘要
我们提出了因果摊销主动结构学习(CAASL),一种主动干预设计策略,可以选择自适应、实时的干预,且不需要访问似然。该策略是一个基于Transformer的摊销网络,通过在设计环境的模拟器上进行强化学习训练,并使用奖励函数来衡量真实因果图与从收集数据推断出的因果图后验的接近程度。在合成数据和单细胞基因表达模拟器上,我们通过实验证明,通过我们的策略获取的数据比替代策略能更好地估计底层因果图。我们的设计策略成功地在训练环境的分布上实现了摊销干预设计,同时也能很好地泛化到测试时设计环境中的分布偏移。此外,我们的策略还表现出对维度高于训练时的设计环境以及未训练过的干预类型的出色零样本泛化能力。
引用
@article{arxiv.2405.16718,
title = {Amortized Active Causal Induction with Deep Reinforcement Learning},
author = {Yashas Annadani and Panagiotis Tigas and Stefan Bauer and Adam Foster},
journal= {arXiv preprint arXiv:2405.16718},
year = {2024}
}