中文

审计语言模型在指导招聘决策中的应用

应用统计 2024-04-05 v1 计算与语言

摘要

随着大语言模型(LLMs)的快速发展,防止算法偏见的监管努力变得日益紧迫,这些机器学习模型在广泛的任务上能够取得媲美人类专家的性能。这些举措的一个核心主题是算法“审计”,但现行法规以及科学文献对于如何进行这些评估几乎没有提供指导。在此,我们提出并研究了一种审计算法的方法:通信测试,这是一种广泛应用于检测人类判断中偏见的工具。在就业场景下,通信测试旨在通过实验性地操纵提交的申请材料中暗示申请者人口统计特征(例如其列出的姓名)的元素,来衡量种族和性别对决策的影响程度。我们应用这种方法审计了多个最先进的 LLMs 生成的候选人评估,使用了一个大型公立学区 K-12 教学职位申请的新型语料库。我们发现了中等程度的种族和性别差异的证据,这一模式在改变输入到模型的申请材料类型以及向 LLMs 呈现任务的方式时基本保持稳健。最后,我们讨论了通信测试在审计算法方面的一些重要局限性。

关键词

引用

@article{arxiv.2404.03086,
  title  = {Auditing the Use of Language Models to Guide Hiring Decisions},
  author = {Johann D. Gaebler and Sharad Goel and Aziz Huq and Prasanna Tambe},
  journal= {arXiv preprint arXiv:2404.03086},
  year   = {2024}
}