中文

利用计算语言模型检测招聘广告中语境感知的歧视

机器学习 2022-02-09 v1

摘要

歧视性招聘广告在世界范围内受到反对,但却持续存在。招聘广告中的歧视可通过直接提及候选人的人口统计成员身份而显式存在。更隐性的歧视形式也存在,可能并不总非法,但仍影响申请人的多样性。如最近在荷兰观察到的,显式书面歧视仍存在于大量招聘广告中。当前检测显式歧视的工作涉及识别包含潜在歧视性词汇(如“年轻”或“男性”)的招聘广告。然而,由于精度低,自动检测效率不高:例如“我们是一家年轻的公司”或“主要与男性患者打交道”是包含显式词汇的短语,但语境表明它们并不反映歧视性内容。在本文中,我们展示了基于机器学习的计算语言模型如何通过识别潜在歧视性词汇在歧视性语境中的使用来提高显式歧视检测的精度。我们关注性别歧视,在过滤显式词汇时其确实面临低精度问题。首先,我们创建了招聘广告中性别歧视的数据集。其次,我们研究了多种用于歧视性语境检测的计算语言模型。第三,我们评估了这些模型在语境中检测未预见歧视性词汇的能力。结果表明,基于机器学习的方法能以高精度检测显式性别歧视,并有助于发现新形式的歧视。因此,所提方法能大幅提高检测高度疑似歧视性招聘广告的效率。进而,这可降低招聘流程伊始所经历的歧视。

关键词

引用

@article{arxiv.2202.03907,
  title  = {Context-Aware Discrimination Detection in Job Vacancies using Computational Language Models},
  author = {S. Vethman and A. Adhikari and M. H. T. de Boer and J. A. G. M. van Genabeek and C. J. Veenman},
  journal= {arXiv preprint arXiv:2202.03907},
  year   = {2022}
}

备注

17 pages, 2 figures