平衡不确定性与样本多样性:利用最小置信度样本的多样性进行有效主动学习
计算机视觉与模式识别
2026-05-22 v1
摘要
深度学习模型,包括卷积神经网络 (CNN) 和视觉转换器 (ViT),在目标分类、检测、分割、生成等众多计算机视觉任务中取得了最先进的性能。然而,这些模型数据需求量大,需大量训练数据来学习数百万或数十亿参数。尤其对于监督学习任务,精心策划大量标记样本用于模型训练是昂贵且耗时的。主动学习 (AL) 多年来用于解决此问题。现有的主动学习方法旨�从大量未标记样本中选择要标注的样本,要么具有高多样性,要么具有高不确定性。选择此类样本可能阻碍模型性能,因为仅单维度池化,要么高度多样,要么高度不确定。在本文中,我们提出四种新颖的混合采样方法,用于同时池化易样本和难样本且保持多样性。为验证所提方法的有效性,我们分别使用高置信度样本和低置信度样本开展大量实验。我们观察到,所提出的混合采样方法 Least Confident and Diverse (LCD) 相对于最先进的方法表现持续更佳。我们观察到,选择不确定且多样的实例有助于模型学习更具代表性的特征。本研究相关代码将置于 https://github.com/XXX/LCD。
引用
@article{arxiv.2605.22169,
title = {Balancing Uncertainty and Diversity of Samples: Leveraging Diversity of Least, High Confidence Samples for Effective Active Learning},
author = {Vipul Arya and S. H. Shabbeer Basha and Srikrishna U N and Sunainha Vijay and Snehasis Mukherjee},
journal= {arXiv preprint arXiv:2605.22169},
year = {2026}
}