我们如何定义伤害影响数据标注:解释标注者如何区分仇恨、攻击性与毒性评论
计算与语言
2023-09-28 v1 计算机与社会
摘要
计算社会科学的研究在机器学习与自然语言处理方面取得了进展,以支持内容审核员检测有害内容。这些进展常依赖于众包标注者标注的有害内容训练数据集。在为这些算法生成训练数据而设计标注任务指令时,研究者常将我们训练算法检测的伤害概念——'仇恨的'、'攻击性的'、'毒性的'、'种族主义的'、'性别歧视的'等——视为可互换的。在本工作中,我们研究了研究者定义'伤害'的方式是否影响标注结果。利用韦恩图、信息增益比较与内容分析,我们揭示标注者并非可互换地使用'仇恨的'、'攻击性的'与'毒性的'概念。我们确定伤害定义的特征与标注者的个体特征在很大程度上解释了标注者如何不同地使用这些术语。我们的结果提供了经验证据,不鼓励在内容审核研究中将伤害概念互换使用的常见做法。相反,研究者应基于其研究目标就分析哪些伤害概念做出具体选择。认识到研究者常受资源限制,我们也鼓励研究者在所关注概念与现成有害内容检测算法识别的概念不同时,提供信息以界定其发现的适用范围。最后,我们鼓励算法提供方确保其工具能适应特定语境的内容检测目标(例如,征求工具用户的反馈)。
引用
@article{arxiv.2309.15827,
title = {How We Define Harm Impacts Data Annotations: Explaining How Annotators Distinguish Hateful, Offensive, and Toxic Comments},
author = {Angela Schöpke-Gonzalez and Siqi Wu and Sagar Kumar and Paul J. Resnick and Libby Hemphill},
journal= {arXiv preprint arXiv:2309.15827},
year = {2023}
}
备注
29 pages, 1 figure, 9 tables