中文

基于主导集的主动学习用于文本分类及其在在线社交媒体中的应用

计算与语言 2022-02-02 v1

摘要

在线社交媒体中自然语言处理(NLP)的最新进展显然归功于大规模数据集。然而,标注、存储和处理大量文本数据点(例如推文)仍然具有挑战性。此外,在诸如仇恨言论检测等应用中,标注包含攻击性内容的足够大规模数据集会对人类标注者造成心理和情绪上的负担。因此,能够充分利用显著更少标注数据点的 NLP 方法备受关注。在本文中,我们提出了一种新颖的基于池的主动学习方法,可用于以最小标注成本训练大型无标注语料库。为此,我们提出在特征空间中寻找局部簇的主导集。这些集合代表了数据中最大内聚的结构。然后,选择不属于任何主导集的样本用于训练模型,因为它们代表了局部簇的边界且更难以分类。我们提出的方法无需调参,使其与数据集无关,并且它能以显著更少的数据点近似达到全训练数据的分类准确率。此外,与最先进的主动学习策略相比,我们的方法取得了更高的性能。进而,我们提出的算法能够将传统的主动学习分数(如基于不确定性的分数)纳入其选择准则。我们在不同数据集和使用不同神经网络架构上展示了方法的有效性。

关键词

引用

@article{arxiv.2202.00540,
  title  = {Dominant Set-based Active Learning for Text Classification and its Application to Online Social Media},
  author = {Toktam A. Oghaz and Ivan Garibay},
  journal= {arXiv preprint arXiv:2202.00540},
  year   = {2022}
}

备注

11 pages, 5 tables, 1 figure