重访“垃圾进,垃圾出”:机器学习应用论文如何报告人工标注训练数据?
机器学习
2021-07-07 v1 计算机与社会
社会与信息网络
摘要
监督式机器学习从标注训练数据中自动推导模型,其质量仅取决于该数据的质量。本研究建立在先前工作基础之上,该工作调查了在单一领域(社交媒体平台)内应用机器学习(ML)出版物在标注训练数据方面遵循“最佳实践”的程度。在本文中,我们拓展研究至远更广泛学科中应用监督式ML的出版物,聚焦于人工标注数据。我们报告了跨学科ML应用论文随机样本在多大程度上给出了关于是否遵循最佳实践的特定细节,同时承认应用领域越广必然带来标注与注释方法的更大多样性。由于大量机器学习研究与教育仅关注一旦获得训练数据的“真值”或“金标准”后所进行的工作,讨论此类数据本身是否可靠这一同等重要方面的问题尤为相关。当应用于各类专业领域时,该判定变得愈发复杂,因为标注既可能是几乎不需要背景知识的任务,也可能必须由具备职业专业知识的人员完成。
引用
@article{arxiv.2107.02278,
title = {"Garbage In, Garbage Out" Revisited: What Do Machine Learning Application Papers Report About Human-Labeled Training Data?},
author = {R. Stuart Geiger and Dominique Cope and Jamie Ip and Marsha Lotosh and Aayush Shah and Jenny Weng and Rebekah Tang},
journal= {arXiv preprint arXiv:2107.02278},
year = {2021}
}