不浪费任何标注:通过软标签改进单标签分类器
计算与语言
2023-11-10 v1 人工智能
机器学习
摘要
本文中,我们探讨了客观单标签分类任务中常见数据标注与训练方法的局限性。通常,在此类任务标注时,仅要求标注者为每个样本提供单个标签,且当通过多数投票决定最终硬标签时,标注者间的不一致被丢弃。我们质疑这一传统做法,承认由于数据样本中的模糊性与上下文缺失,确定恰当标签可能困难。我们的软标签方法不丢弃此类模糊标注中的信息,而是利用它们进行训练。我们的发现表明,额外的标注者信息,如置信度、次要标签及不一致性,可有效用于生成软标签。使用这些软标签训练分类器,可提升在硬标签测试集上的性能与校准。
引用
@article{arxiv.2311.05265,
title = {Don't Waste a Single Annotation: Improving Single-Label Classifiers Through Soft Labels},
author = {Ben Wu and Yue Li and Yida Mu and Carolina Scarton and Kalina Bontcheva and Xingyi Song},
journal= {arXiv preprint arXiv:2311.05265},
year = {2023}
}
备注
Accepted to EMNLP 2023 (Findings)