中文

识别与消除学术推荐信中的性别线索:一种可解释性案例研究

机器学习 2026-04-15 v1 计算机与社会

摘要

推荐信(Letters of Recommendation, LoRs)可能携带隐式性别化语言模式,潜在影响雇佣和录取等下游决策。在本工作中,我们调查基于Transformer编码器模型以及大型语言模型(Large Language Models, LLMs)在学术推荐信中推断申请人性别的能力——在明确的指示符(如姓名和代词)被去性别化后仍可实现此目标。使用DistilBERT、RoBERTa和Llama 2三种模型对匿名化和去性别化后的推荐信进行性别分类,观察到显著的性别泄漏,分类准确率可达68%。文本解释方法(如TF-IDF和SHAP)表明,某些语言模式是性别的强烈代理,例如“情感的”和“人文主义的”常与女性申请人关联。作为构建真正性别中性推荐信的实验,这些隐式性别线索被移除后,分类准确率下降最高可达5.5%,宏平均F1分数下降2.7%。然而,申请人性别预测仍高于随机。我们的发现表明,1)推荐信包含难以消除的性别识别线索,可能激活决策中的偏见;2)虽然我们的技术框架是实现更公平学术和专业评估的具体步骤,但仍需进一步探讨性别在推荐信审查中所扮演的角色。总体而言,我们的发现动机了对现实世界学术推荐信进行上游审计,以补充模型层面的公平性干预。

关键词

引用

@article{arxiv.2604.12337,
  title  = {Identifying and Mitigating Gender Cues in Academic Recommendation Letters: An Interpretability Case Study},
  author = {Charlotte S. Alexander and Shane Storks and Souradip Pal and Sayak Chakrabarty and Arushi Sharma and Mlen-Too Wesley and Bailey Russo},
  journal= {arXiv preprint arXiv:2604.12337},
  year   = {2026}
}

备注

17 pages, 3 figures