TriCon-Fair:用于缓解预训练语言模型社会偏见的三元对比学习
计算与语言
2025-11-04 v1
摘要
大语言模型的日益广泛使用引发了关于社会偏见传播的重大担忧,这可能导致有害且不公平的结果。然而,现有的去偏方法将有偏样本和无偏样本独立处理,从而忽略了它们之间的相互关系。这种疏忽导致隐藏的负-正耦合,即一个群体的改进可能不慎损害另一个群体,使残余社会偏见得以持续。本文引入 TriCon-Fair,一种对比学习框架,采用解耦损失结合三元组和语言建模术语,以消除正-负耦合。我们的 TriCon-Fair 为每个锚点指定明确的有偏负样本和无偏正样本,解耦推-拉动力学,避免正-负耦合,并联合优化语言建模(LM)目标以保留通用能力。实验结果表明,TriCon-Fair 在现有去偏基准之外显著减少了歧视性输出,同时保持强大的下游性能。这表明我们提出的 TriCon-Fair 为敏感 NLP 应用提供了实用且伦理的解决方案。
引用
@article{arxiv.2511.00854,
title = {TriCon-Fair: Triplet Contrastive Learning for Mitigating Social Bias in Pre-trained Language Models},
author = {Chong Lyu and Lin Li and Shiqing Wu and Jingling Yuan},
journal= {arXiv preprint arXiv:2511.00854},
year = {2025}
}