中文

CHEF:一种用于迭代清理标签不确定性的廉价快速流水线(技术报告)

数据库 2021-07-27 v2 机器学习

摘要

对于许多机器学习任务(如医学图像分类任务),高质量标签的获取成本高昂。因此,弱监督工具生成的概率(弱)标签被用于启动一个过程:识别具有弱标签的有影响力样本,并由若干人工标注者清理以提升模型性能。为降低该过程的整体成本与计算开销,我们提出一种称为 CHEF(CHEap and Fast label cleaning,廉价快速标签清理)的方案,包含以下三个组件。首先,为减少人工标注者成本,我们使用 Infl,其对最具影响力的训练样本优先清理并提供清洗后标签,从而节省一名人工标注者的成本。其次,为加速样本选择阶段与模型构建阶段,我们使用 Increm-Infl 增量生成有影响力样本,并使用 DeltaGrad-L 增量更新模型。第三,我们重新设计典型的标签清理流水线,使人工标注者迭代清理较小批次样本而非一次性大批次样本。这带来了更好的整体模型性能,并可在达到预期模型性能时提前终止。大量实验表明,我们的方法在取得良好模型预测性能的同时实现了显著加速。

关键词

引用

@article{arxiv.2107.08588,
  title  = {CHEF: A Cheap and Fast Pipeline for Iteratively Cleaning Label Uncertainties (Technical Report)},
  author = {Yinjun Wu and James Weimer and Susan B. Davidson},
  journal= {arXiv preprint arXiv:2107.08588},
  year   = {2021}
}

备注

Accepted by VLDB 2021