论主动学习中样本的可复用性
机器学习
2022-06-14 v1
摘要
主动学习中一个有趣但未得到广泛研究的问题是样本可复用性:为一个学习器选择的样本在多大程度上可以被另一个学习器复用?本文解释了为何样本可复用性具有实际意义、为何可复用性可能成为问题、如何通过重要性加权主动学习改善可复用性,以及实现普遍可复用性仍存在哪些障碍。通过理论论证和实际演示,本文论证了普遍可复用性是不可能的。由于每种主动学习策略都必须对样本空间的某些区域进行欠采样,依赖于这些区域样本的学习器将从随机样本选择中学到更多。本文描述了若干重要性加权主动学习的实验,展示了可复用性问题在实践中的影响。实验证实普遍可复用性并不存在,尽管在某些情况下——在某些数据集和某些分类器对上——存在样本可复用性。最后,本文探讨了能够保证两个分类器之间可复用性的条件。
引用
@article{arxiv.2206.06276,
title = {On the reusability of samples in active learning},
author = {Gijs van Tulder and Marco Loog},
journal= {arXiv preprint arXiv:2206.06276},
year = {2022}
}