中文

信用评分中的结构性性别偏见:代理变量泄露

机器学习 2026-01-27 v1

摘要

随着金融机构越来越多地采用机器学习进行信用风险评估,算法偏见的持续存在仍然是实现公平金融包容性的关键障碍。本研究对台湾信用违约数据集中的结构性性别偏见进行了全面审计,特别挑战了“通过盲目实现公平”的盛行教条。尽管移除了显式的受保护属性并应用了行业标准的公平性干预措施,我们的结果表明,性别预测信号仍然深深嵌入在非敏感特征中。利用 SHAP(SHapley Additive exPlanations),我们识别出婚姻状况、年龄和信用额度等变量作为性别的强代理变量,使得模型在保持歧视性路径的同时显得在统计上是公平的。为了在数学上量化这种泄露,我们采用了对抗性逆建模框架。我们的发现表明,受保护的性别属性可以仅从非敏感金融特征中重建,其 ROC AUC 分数为 0.65,这表明传统的公平性审计不足以检测隐含的结构性偏见。这些结果主张从表面上的统计均等转向金融 AI 中的因果感知建模和结构性问责。

关键词

引用

@article{arxiv.2601.18342,
  title  = {Structural Gender Bias in Credit Scoring: Proxy Leakage},
  author = {Navya SD and Sreekanth D and SS Uma Sankari},
  journal= {arXiv preprint arXiv:2601.18342},
  year   = {2026}
}