测试分布感知的主动学习:一种针对分布偏移与离群点的原则性方法
机器学习
2021-11-23 v2 机器学习
摘要
在 MacKay (1992) 的基础上,我们认为传统的基于模型的主动学习方法——如 BALD——存在一个根本缺陷:它们未能直接考虑输入变量在测试时的分布。这可能导致采集策略出现病态,因为对模型参数最具信息量的样本未必对预测最具信息量:例如,当池集数据比最终预测任务的数据更分散时,或者当池样本与测试样本的分布不同时。为纠正这一点,我们重新审视了一种基于最大化关于可能的未来预测的期望信息增益的采集策略,称之为期望预测信息增益(EPIG)。由于 EPIG 在批量采集时扩展性不佳,我们进一步研究了一种替代策略,即 BALD 与 EPIG 的混合策略,称之为联合期望预测信息增益(JEPIG)。我们考虑在多个数据集上将两者用于贝叶斯神经网络的主动学习,考察其在池集分布偏移下的行为。
引用
@article{arxiv.2106.11719,
title = {Test Distribution-Aware Active Learning: A Principled Approach Against Distribution Shift and Outliers},
author = {Andreas Kirsch and Tom Rainforth and Yarin Gal},
journal= {arXiv preprint arXiv:2106.11719},
year = {2021}
}