模拟类不平衡与标签漂移下的主动学习
物理与社会
2026-01-13 v1
摘要
主动学习旨在从未标记的数据集中选择最具信息性的样本。这在数据量大且标记成本高昂的场景中非常有用,如机器视觉或医学影像。机器视觉的两个特殊之处:首先,大多数生成的图像无缺陷,其次,生成的图像数量如此之大以至于我们无法存储所有已获取的图像。这导致一方面出现强烈的缺陷分布不平衡,另一方面由于存储限制导致潜在的标签漂移。为理解这两种不平衡形式如何影响主动学习算法,我们提出了一个基于两个开源数据集的仿真研究。我们人工创建数据集,控制类不平衡和标签漂移的水平。比较了三种标准的主动学习选择策略:随机抽样、熵基选择和核心集选择。我们展示了主动学习策略,特别是熵基选择和核心集选择,即使在高度不平衡的数据集上仍然有趣且有效。我们还说明并度量了在标签漂移严重情况下效率损失的情形。
引用
@article{arxiv.2601.06206,
title = {Reliability is a new science: we are on the right way},
author = {Xiao-Yang Li and Shi-Shun Chen and Waichon Lio and Rui Kang},
journal= {arXiv preprint arXiv:2601.06206},
year = {2026}
}