面向长期标注者:一种有监督标签聚合基线方法
人机交互
2023-11-28 v1 机器学习
摘要
依靠众包工作者,数据众包平台能够高效提供大量标注数据。由于众包工作者标注质量参差不齐,现代技术借助冗余标注及后续标签聚合来推断真实标签。然而,这些方法在推理过程中需要更新模型,给实际部署带来挑战。与此同时,近年来许多数据标注任务开始要求熟练且有经验的标注者,导致对长期标注者的需求日益增长。这些标注者可在众包平台上留下大量历史标注记录,有助于标签聚合,却被以往工作所忽视。为此,本文提出一种新颖的标签聚合技术,其在推理时无需任何模型更新,且能充分挖掘历史标注记录。我们称之为 SuperLA,一种有监督标签聚合(Supervised Label Aggregation)方法。该模型内部设计了三类输入特征与一个简洁的神经网络结构,将全部信息融合后输出聚合标签。基于在 22 个公开数据集与 11 种基线方法上的对比实验,我们发现 SuperLA 不仅在推理性能上优于所有基线,且在效率方面具有显著优势。
引用
@article{arxiv.2311.14709,
title = {Towards Long-term Annotators: A Supervised Label Aggregation Baseline},
author = {Haoyu Liu and Fei Wang and Minmin Lin and Runze Wu and Renyu Zhu and Shiwei Zhao and Kai Wang and Tangjie Lv and Changjie Fan},
journal= {arXiv preprint arXiv:2311.14709},
year = {2023}
}