优化类别级概率重加权系数以实现公平的提示准确性
计算与语言
2025-08-13 v8
摘要
尽管我们为 LLM 进行对齐和安全性工程,但它们往往揭示了来自预训练数据统计规律性的偏见(包括不均衡的共现情况以及反映人类认知偏见的刻板印象关联)。这导致分类和问答任务中类别准确率不均。这种类别准确率的差异并非仅凭架构/训练演变或数据规模就能解决,使得后处理纠正对于实现公平性能至关重要。为缓解 LLM 类别准确率不平衡问题,我们开发了一种后处理概率重加权方法,直接针对非可微的性能驱动和公平性对齐指标进行优化,通过一种新颖的 COBias 指标来突出类别准确率之间的差异。该后处理偏差缓解方法基于离散优化,其目标为非线性整数规划(NIP),并采用一种具有理论收敛保证的高效元启发式求解框架。该方法在模型无关方面运行,从输出类别概率中学习重加权系数,以调整 LLM 的推理输出,而无需更新内部权重。评估结果表明其有效性:COBias 降低了 61%,总体准确率提高了 18%,并在多样化的提示配置下实现稳健的任务内泛化。
引用
@article{arxiv.2405.07623,
title = {Optimizing Class-Level Probability Reweighting Coefficients for Equitable Prompting Accuracy},
author = {Ruixi Lin and Yang You},
journal= {arXiv preprint arXiv:2405.07623},
year = {2025}
}