中文

AnchorAL:面向大型且不均衡数据集的计算高效主动学习

机器学习 2024-10-17 v2 计算与语言

摘要

针对不均衡分类任务的主动学习具有挑战性,因为少数类自然很少出现。因此,收集大量未标记数据池对于捕获少数类实例至关重要。标准的基于数据池的主动学习在大型数据池上计算成本高昂,且通常因过拟合初始决策边界而导致准确率低下,从而无法探索输入空间并找到少数类实例。为了解决这些问题,我们提出了 AnchorAL。在每次迭代中,AnchorAL 从已标记集合中选择特定类别的实例(即锚点),并从数据池中检索最相似的未标记实例。然后将生成的子池用于主动学习。通过使用固定大小的小子池,AnchorAL 允许将任何主动学习策略扩展到大型数据池。通过在每次迭代中动态选择不同的锚点,它促进了类别平衡并防止过拟合初始决策边界,从而促进发现少数类实例的新聚类。在不同分类任务、主动学习策略和模型架构的实验中,AnchorAL 更快,通常将运行时间从数小时缩短至数分钟; 训练出性能更强的模型; 并且返回比竞争方法更均衡的数据集。

关键词

引用

@article{arxiv.2404.05623,
  title  = {AnchorAL: Computationally Efficient Active Learning for Large and Imbalanced Datasets},
  author = {Pietro Lesci and Andreas Vlachos},
  journal= {arXiv preprint arXiv:2404.05623},
  year   = {2024}
}

备注

Published at the NAACL 2024 Conference (main)