FAIRE:评估AI驱动简历评估中的种族与性别偏见
计算与语言
2025-04-03 v1 人工智能
摘要
在AI驱动招聘正逐渐改变招聘实践的今天,公平性和偏见问题日益受到关注。为探讨这些问题,我们引入了一个基准测试FAIRE(Fairness Assessment In Resume Evaluation),用于测试在不同行业中,针对不同种族或性别身份的简历进行评估时,大型语言模型 (LLM) 所呈现的种族和性别偏见。我们采用两种方法——直接评分和排序——来衡量模型性能随着简历被轻微修改以反映不同种族或性别身份而产生的变化。我们的发现表明,尽管每个模型都呈现出一定程度的偏见,但其幅度和方向差异相当大。该基准测试提供了一种清晰的方法来检验这些差异,为我们提供了关于AI基于招聘工具公平性的宝贵见解。它凸显了需要采取措施来减少AI驱动招聘中偏见的紧迫性。我们的基准代码和数据集已开源于我们的存储库:https://github.com/athenawen/FAIRE-Fairness-Assessment-In-Resume-Evaluation.git。
引用
@article{arxiv.2504.01420,
title = {FAIRE: Assessing Racial and Gender Bias in AI-Driven Resume Evaluations},
author = {Athena Wen and Tanush Patil and Ansh Saxena and Yicheng Fu and Sean O'Brien and Kevin Zhu},
journal= {arXiv preprint arXiv:2504.01420},
year = {2025}
}