评估 LLM 在招聘决策中的前景与陷阱
机器学习
2025-07-29 v2 计算与语言
计算机与社会
摘要
在招聘中使用大语言模型 (LLM) 有望简化候选人筛选,但在缺乏充分保障措施的情况下,也引发了关于准确性和算法偏见的严重担忧。在本研究中,我们对几个最先进的基础 LLM(包括来自 OpenAI、Anthropic、Google、Meta 和 Deepseek 的模型)进行基准测试,并将它们与我们专有的特定领域招聘模型 (Match Score) 进行比较,以实现求职候选人匹配。我们评估了每个模型的预测准确性(ROC AUC、Precision-Recall AUC、F1-score)和公平性(在声明的性别、种族和交叉子群体之间截断分析的影响比率)。我们在包含约 10,000 个真实近期候选人-职位对的数据集上进行的实验表明,Match Score 在准确性上优于通用 LLM(ROC AUC 为 0.85 对 0.77),并在各人口群体中实现了显著更公平的结果。值得注意的是,Match Score 获得了 0.957 的最低种族影响比率(接近均等),而最佳 LLM 为 0.809 或更低(交叉子群体分别为 0.906 对 0.773)。我们讨论了为什么预训练偏见可能导致缺乏充分保障措施的 LLM 在招聘场景中传播社会偏见,而定制监督模型可以更有效地缓解这些偏见。我们的发现强调了在招聘等高风险领域部署 AI 时特定领域建模和偏见审计的重要性,并警告在此类任务中不要在没有广泛公平性保障措施的情况下依赖现成的 LLM。此外,我们以经验证据表明,在招聘中选择准确性和公平性之间不应存在二分法:设计良好的算法可以同时实现招聘的准确性和结果的公平性。
引用
@article{arxiv.2507.02087,
title = {Evaluating the Promise and Pitfalls of LLMs in Hiring Decisions},
author = {Eitan Anzenberg and Arunava Samajpati and Sivasankaran Chandrasekar and Varun Kacholia},
journal= {arXiv preprint arXiv:2507.02087},
year = {2025}
}
备注
10 pages, 2 figures, 2 tables. Submitted to NeurIPS 2025