如训练者,如机器人?算法内容审核中的偏见继承
计算机与社会
2017-09-06 v1 计算与语言
机器学习
摘要
互联网已成为“网络化公众”表达观点和参与辩论的核心媒介。攻击性评论和人身攻击会抑制在这些空间中的参与。自动化内容审核旨在使用在大量人工标注攻击性的文本语料上训练的机器学习分类器来克服这个问题。虽然这样的系统可以帮助鼓励更文明的辩论,但它们必须跨越固有的规范性可争议边界,并且受到提供训练数据的人类评分者特殊规范的影响。实施此类措施的平台的一个重要目标可能是确保它们不会不当地偏向或反对特定的攻击性规范。本文通过一项使用现有标注攻击性评论数据集的案例研究,提供了一些可以衡量算法内容审核系统规范性偏见的探索性方法。我们在由不同人口统计子集(男性和女性)标注的评论上训练分类器,以理解这些群体之间攻击性概念的差异如何影响所得模型在各种测试集上的性能。最后,我们讨论了给定讨论参与者所需观点多样性水平下,算法审核系统实施者面临的一些伦理选择。
引用
@article{arxiv.1707.01477,
title = {Like trainer, like bot? Inheritance of bias in algorithmic content moderation},
author = {Reuben Binns and Michael Veale and Max Van Kleek and Nigel Shadbolt},
journal= {arXiv preprint arXiv:1707.01477},
year = {2017}
}
备注
12 pages, 3 figures, 9th International Conference on Social Informatics (SocInfo 2017), Oxford, UK, 13--15 September 2017 (forthcoming in Springer Lecture Notes in Computer Science)