中文

超越主动学习:通过自动标注、人工纠正与人工验证释放人机交互的全部潜力

机器学习 2023-06-05 v1 人机交互

摘要

主动学习(AL)是一种人在回路框架,用于交互式且自适应地标注数据实例,从而相比随机采样在模型性能上实现显著提升。AL 方法通过选择最难标注的实例来运作,通常依赖于多样性和不确定性的概念。然而,我们认为当前这些 AL 范式并未充分利用由自动标签建议所赋予的人机交互的全部潜力。事实上,我们表明对于许多分类任务和数据集,大多数人在验证自动建议标签是否正确时所花费的时间,比他们将错误建议改为正确标签(或在无任何建议情况下从头标注)少 3×3\times4×4\times。利用这一结果,我们提出 CLARIFIER(aCtive LeARnIng From tIEred haRdness),一种交互式学习框架,通过利用验证成本的降低来实现更有效的人机交互使用。通过对困难(不确定)实例采用现有 AL 方法、对中间实例采用基于每类子模互信息函数的新型标签建议方案、对简单(置信)实例采用最高置信度自动标注,CLARIFIER 在多个数据集上——尤其在具有大量类别的数据集上——相比现有 AL 方法可将相对标注成本降低近 1.5×\times 到 2×\times

关键词

引用

@article{arxiv.2306.01277,
  title  = {Beyond Active Learning: Leveraging the Full Potential of Human Interaction via Auto-Labeling, Human Correction, and Human Verification},
  author = {Nathan Beck and Krishnateja Killamsetty and Suraj Kothawade and Rishabh Iyer},
  journal= {arXiv preprint arXiv:2306.01277},
  year   = {2023}
}

备注

14 pages, 8 figures