中文

零轮主动学习

机器学习 2021-08-09 v3

摘要

主动学习(AL)旨在从大型池中识别最有价值的未标注数据点,从而减少标注工作量。传统 AL 框架有两个局限:第一,它们以多轮方式执行数据选择,耗时且不实用。第二,它们通常假设在与未标注池相同域中存在少量可用标注数据点。近期工作基于数据效用学习与优化提出了一轮主动学习的方案,解决了第一个问题,但仍需要同域中初始标注数据点。本文中,我们提出 D2ULO\mathrm{D^2ULO} 作为同时解决两个问题的方案。具体而言,D2ULO\mathrm{D^2ULO} 利用域适应(DA)的思想训练数据效用模型,该模型能有效预测目标域中任意给定未标注数据一旦被标注后的效用。训练好的数据效用模型可用于选择高效用数据,同时提供所选数据效用的估计。我们的算法不依赖目标域中标注者的任何反馈,因此可用于执行零轮主动学习或热启动已有的多轮主动学习策略。实验表明,D2ULO\mathrm{D^2ULO} 在各种域偏移设定下(如真实到真实数据、合成到真实数据)优于现有的配备域适应的最先进 AL 策略。特别地,D2ULO\mathrm{D^2ULO} 适用于源域与目标域标签不匹配的场景,这是现有工作所不支持的。

关键词

引用

@article{arxiv.2107.06703,
  title  = {Zero-Round Active Learning},
  author = {Si Chen and Tianhao Wang and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2107.06703},
  year   = {2021}
}