中文

从万维网进行主动学习

机器学习 2023-02-13 v2

摘要

标注数据是机器学习流程中代价最高的过程之一。主动学习是缓解该问题的标准途径。基于池的主动学习首先构建一未标注数据池,并迭代选择待标注数据,以使所需标注总数最小化,同时保持模型性能高。文献中已提出许多从池中选择数据的有效准则。然而,如何构建池则较少被探索。具体地,多数方法假设一任务专用池可免费获得。本文中,我们主张此类任务专用池并非总可用,并提议使用万维网上大量未标注数据作为池以应用主动学习。由于池极庞大,许多任务的相关数据很可能存在于池中,且我们无需为每个任务显式设计与构建池。挑战在于,因池规模所限,我们无法穷尽计算所有数据的获取分数。我们提出一高效方法 Seafaring,利用用户侧信息检索算法从万维网检索主动学习意义下的信息性数据。实验中,我们使用在线 Flickr 环境作为主动学习的池。该池含逾百亿图像,比文献中现有主动学习池大数个数量级。我们确认我们的方法优于使用小型未标注池的现有途径。

关键词

引用

@article{arxiv.2210.08205,
  title  = {Active Learning from the Web},
  author = {Ryoma Sato},
  journal= {arXiv preprint arXiv:2210.08205},
  year   = {2023}
}

备注

WWW 2023