从每位标注者处获取并利用软标签进行学习
机器学习
2022-08-31 v3 人工智能
计算机与社会
人机交互
摘要
用于训练机器学习(ML)模型的标签至关重要。通常 ML 分类任务的数据集包含硬标签,但利用软标签学习已被证明有益于模型泛化、鲁棒性与校准。早期工作通过融合多位标注者的硬标签来形成软标签取得成功;然而,该方法可能无法收敛到最优标签,且需要大量标注者,成本高且效率低。我们聚焦于从个体标注者高效获取软标签。我们通过众包研究(N=248)在 CIFAR-10 测试集上收集并发布了一个软标签数据集(称为 CIFAR-10S)。我们证明,使用我们的标签进行学习在仅需远少标注者的情况下即可取得与先前方法相当的模型性能——尽管每次获取存在显著的时间成本。因此,我们的获取方法展现出细致的前景,使实践者能以更少标注者享受改进模型性能与可靠性的益处,并为未来数据集构建者提供利用个体标注者更丰富信息(如类别不确定性)的指南。
引用
@article{arxiv.2207.00810,
title = {Eliciting and Learning with Soft Labels from Every Annotator},
author = {Katherine M. Collins and Umang Bhatt and Adrian Weller},
journal= {arXiv preprint arXiv:2207.00810},
year = {2022}
}
备注
Accepted as a Full Paper at the 2022 AAAI Conference on Human Computation and Crowdsourcing