中文

基于阈值的自动标注的承诺与陷阱

机器学习 2024-02-23 v2 人工智能 机器学习

摘要

创建大规模高质量标注数据集是监督机器学习工作流中的主要瓶颈。基于阈值的自动标注(TBAL)利用从人类获得的验证数据来寻找一个置信度阈值,高于该阈值的数据由机器标注,从而减少了对人工标注的依赖。TBAL 正在实践中作为一种广泛使用的解决方案出现。鉴于所得数据集的长生命周期和多样化用途,理解此类自动标注系统获得的数据何时可被依赖至关重要。这是首项分析 TBAL 系统并推导保证机器标注数据质量所需人工标注验证数据量的样本复杂度界的工作。我们的结果提供了两个关键见解。首先,看似糟糕的模型可以自动且准确地标注相当数量的未标注数据。其次,TBAL 系统的一个隐藏缺点是潜在过高的验证数据使用量。这些见解共同描述了使用此类系统的承诺与陷阱。我们通过合成和真实数据集上的大量实验验证了我们的理论保证。

关键词

引用

@article{arxiv.2211.12620,
  title  = {Promises and Pitfalls of Threshold-based Auto-labeling},
  author = {Harit Vishwakarma and Heguang Lin and Frederic Sala and Ramya Korlakai Vinayak},
  journal= {arXiv preprint arXiv:2211.12620},
  year   = {2024}
}

备注

NeurIPS 2023 (Spotlight)