解读人口统计线索:消解毒性分类器中的偏差来源
计算机与社会
2020-07-01 v1 计算与语言
摘要
对有毒评论的审查往往交由不完美的模型来判断。Perspective API 是谷歌技术孵化器 Jigsaw 的产物,或许是工业界使用最广泛的毒性分类器;该模型被包括《纽约时报》在内的多个在线社区用于识别并过滤有毒评论,以维护在线安全。遗憾的是,谷歌的模型倾向于不公平地对包含指代常见被攻击群体身份(如“woman”、“gay”等)的评论赋予更高的毒性分数,因为这些身份在训练数据中常以不敬的方式被提及。结果,边缘群体生成的提及自身身份的评论常被误删。认识到这种非预期偏差并努力缓解其影响十分重要。为解决此问题,我们构建了若干毒性分类器,意在降低非预期偏差的同时保持强劲的分类性能。
引用
@article{arxiv.2006.16402,
title = {Reading Between the Demographic Lines: Resolving Sources of Bias in Toxicity Classifiers},
author = {Elizabeth Reichert and Helen Qiu and Jasmine Bayrooti},
journal= {arXiv preprint arXiv:2006.16402},
year = {2020}
}
备注
8 pages, 13 figures