高风险领域中的偏见检测与消减
计算与语言
2019-10-24 v2
摘要
芝加哥等城市涉帮派青年有时在社交媒体上发帖以表达对敌对帮派的攻击,先前研究已表明深度学习方法可预测帖子中的攻击与损失。为解决这一敏感应用中的偏见可能性,我们开发了一种系统解释最先进模型的方法。我们惊讶地发现,它频繁基于停用词如“a”或“on”作出预测,这种方式可能伤害无攻击意图的社交媒体用户。为应对此偏见,领域专家标注了理据,高亮解释推文被标为“攻击”的词语。这些新标注使我们能定量衡量模型预测的合理性,并构建大幅减少偏见的模型。我们的研究表明,在高风险场景中,仅准确率无法保证良好系统,我们需要新的评估方法。
引用
@article{arxiv.1908.11474,
title = {Detecting and Reducing Bias in a High Stakes Domain},
author = {Ruiqi Zhong and Yanda Chen and Desmond Patton and Charlotte Selous and Kathy McKeown},
journal= {arXiv preprint arXiv:1908.11474},
year = {2019}
}