中文

信号还是噪声?在情境变动下评估大语言模型在简历筛选中的表现及其与人类专家的对比

计算与语言 2025-07-14 v1 综合经济学 经济学

摘要

本研究探讨了大语言模型 (LLM) 在筛选简历以匹配职位描述时是否表现出一致的行为(信号)或随机波动(噪声),以及其性能如何与人类专家相比。我们利用受控数据集,对三种 LLM(Claude、GPT、Gemini)在不同情境(无公司、Firm1 [跨国公司]、Firm2 [初创公司]、Reduced Context)下进行测试,使用相同和随机化的简历,并与三名人力资源招聘专家进行基准测试。方差分析显示,四个八个 LLM 单独测试情境中均存在显著的均值差异,且 LLM 与人类评估在所有情境下均表现出显著差异(p < 0.01)。配对 t 检验表明,GPT 对公司情境适应性最强(p < 0.001),Gemini 部分适应(Firm1 情境下 p = 0.038),而 Claude 适应最弱(p > 0.1),且所有 LLM 在所有情境下均与人类专家存在显著差异。元认知分析揭示了自适应加权模式,与人类评估方法存在明显差异。我们的发现表明,LLM 在详细提示下可提供可解释的模式,但在实际判断方面与人类存在显著分歧,这对其在自动化招聘系统中的部署具有指导意义。

关键词

引用

@article{arxiv.2507.08019,
  title  = {Signal or Noise? Evaluating Large Language Models in Resume Screening Across Contextual Variations and Human Expert Benchmarks},
  author = {Aryan Varshney and Venkat Ram Reddy Ganuthula},
  journal= {arXiv preprint arXiv:2507.08019},
  year   = {2025}
}