中文

REAL:一种基于代表性错误的主动学习方法

机器学习 2023-07-07 v2 人工智能

摘要

在有限标注预算下,主动学习(AL)旨在从未标注池中采样最具信息量的样本以获取标签用于后续模型训练。为此,AL 通常基于不确定性和多样性来衡量未标注样本的信息量。然而,它未考虑带有邻域错误密度的错误样本,这类样本具有提升模型性能的很大潜力。为克服该局限,我们提出 REALREAL,一种为 R\underline{R}epresentative E\underline{E}rrors for A\underline{A}ctive L\underline{L}earning(主动学习的代表性错误)选择数据样本的新方法。它在聚类内将少数类预测识别为伪错误(pseudo errors),并基于估计的错误密度为聚类分配自适应采样预算。在五个文本分类数据集上的大量实验表明,REALREAL 在多种超参数设置下,在准确率和宏 F1 分数上始终优于所有表现最佳的基线。我们的分析还显示,REALREAL 选择了最具代表性的伪错误,其沿决策边界与真实错误的分布相匹配。我们的代码公开于 https://github.com/withchencheng/ECML_PKDD_23_Real。

关键词

引用

@article{arxiv.2307.00968,
  title  = {REAL: A Representative Error-Driven Approach for Active Learning},
  author = {Cheng Chen and Yong Wang and Lizi Liao and Yueguo Chen and Xiaoyong Du},
  journal= {arXiv preprint arXiv:2307.00968},
  year   = {2023}
}

备注

Accepted by ECML/PKDD 2023