防止由数据集偏移导致的失败:学习可迁移的预测模型
机器学习
2019-03-01 v2 人工智能
机器学习
摘要
当训练分布与目标分布不同时,经典监督学习会产生不可靠的模型,且大多数现有解决方案需要来自目标域的样本。我们提出了一种主动方法,通过纳入对数据生成过程中预期会不同的方面的先验知识(表述于因果选择图中),来学习训练域中可泛化到目标域的关系。具体而言,我们从联合分解中移除由不稳定机制生成的变量,从而得到手术估计量——一种对各环境间差异保持不变的干预分布。我们证明,手术估计量比仅考虑条件关系的先前方法在严格更多的场景下发现稳定关系,并在模拟实验中予以展示。我们还在真实世界数据上进行了评估,其真实因果图未知,结果与完全数据驱动的方法相比具有竞争力。
引用
@article{arxiv.1812.04597,
title = {Preventing Failures Due to Dataset Shift: Learning Predictive Models That Transport},
author = {Adarsh Subbaswamy and Peter Schulam and Suchi Saria},
journal= {arXiv preprint arXiv:1812.04597},
year = {2019}
}
备注
In Proceedings of the 22nd International Conference on Artificial Intelligence and Statistics (AISTATS), 2019. Previously presented at the NeurIPS 2018 Causal Learning Workshop