中文

黑箱模型公平性:通过后处理实现封闭LLM的公平算法

机器学习 2025-08-18 v1 计算与语言 计算机与社会

摘要

指令微调的大型语言模型(LLM)使构建预测模型的零样本或少样本提示范式成为可能。这种便利性,结合LLM能力持续进步的发展,潜在推动其在广泛领域的采用,包括组公平性(防止不同人口统计群体之间产生不平等影响)至关重要的高风险应用。现有大多数针对LLM分类器强制执行组公平性的方法依赖于通过模型微调或在最终层嵌入上进行头部微调的传统公平算法,但这些方法在封闭权重LLM的上下文学习设置下(包括今天一些最具能力的商业模型,如GPT-4、Gemini和Claude)无法适用。本文提出一种框架,通过提示从封闭权重LLM派生公平分类器:将LLM视为特征提取器,通过针对指定公平准则设计的提示从其概率预测(如token对数概率)中获取特征;随后对这些特征应用公平算法,以后验方式训练轻量级公平分类器。实验在包括三个表格数据集在内的五个数据集上表明,我们框架从的开源权重LLM和封闭权重LLM中派生的分类器在准确率与公平性之间实现了强大的权衡;特别是,我们的框架数据高效,并优于在LLM嵌入(即头部调优)或从原始表格特征从零训练的公平分类器。

关键词

引用

@article{arxiv.2508.11258,
  title  = {Group Fairness Meets the Black Box: Enabling Fair Algorithms on Closed LLMs via Post-Processing},
  author = {Ruicheng Xian and Yuxuan Wan and Han Zhao},
  journal= {arXiv preprint arXiv:2508.11258},
  year   = {2025}
}