垃圾进,垃圾出?社会计算中的机器学习应用论文是否报告了人类标注训练数据的来源?
计算机与社会
2019-12-19 v1 计算与语言
数字图书馆
机器学习
摘要
许多面向新应用领域的机器学习项目涉及由人类组成的团队为特定目的标注数据,从雇佣众包工作者到论文作者自行标注数据。此类任务与(或是一种)结构化内容分析,而后者是社会科学与人文科学中 longstanding 的方法论,具有许多既定最佳实践。在本文中,我们调查了社会计算中的机器学习应用论文样本——具体为来自 ArXiv 和传统出版物、对 Twitter 数据执行 ML 分类任务的论文——在多大程度上给出了关于是否遵循此类最佳实践的细节。我们的团队对每篇论文进行了多轮结构化内容分析,作出如下判定:论文是否报告了标注者是谁、其资质如何、是否独立标注了相同条目、是否披露了评分者间信度指标、给予标注者的培训和/或指示程度、是否披露众包工作者的报酬,以及训练数据是否公开可用。我们发现此类实践是否被遵循和记录存在很大差异。许多机器学习研究与教育聚焦于一旦获得训练数据的“黄金标准”后所做的事,但我们讨论了关于此类数据本身是否可靠这一同等重要方面的问题。
引用
@article{arxiv.1912.08320,
title = {Garbage In, Garbage Out? Do Machine Learning Application Papers in Social Computing Report Where Human-Labeled Training Data Comes From?},
author = {R. Stuart Geiger and Kevin Yu and Yanlai Yang and Mindy Dai and Jie Qiu and Rebekah Tang and Jenny Huang},
journal= {arXiv preprint arXiv:1912.08320},
year = {2019}
}
备注
18 pages, includes appendix