语言模型眼中众生平等:反事实感知的公平文本生成
计算与语言
2023-11-10 v1 计算机与社会
机器学习
摘要
语言模型(LMs)中的公平性问题仍是一项长期挑战,因为训练数据中固有的偏见会被模型延续并影响下游任务。近期方法采用昂贵的重训练,或通过在推理时约束模型输出以区别于一组有偏模板或示例来进行去偏。尽管如此,它们并未解决公平性的首要目标,即在不同人口群体间保持公平。本文中,我们主张:在特定语境下推理 LM 为某一人口群体生成无偏输出,源于其对同一语境下其他人口群体输出的感知。为此,我们提出反事实感知公平推理(CAFIE)框架,该框架动态比较模型对多样化人口群体的理解以生成更公平的句子。我们使用不同规模的基干 LM 并在三个多样数据集上进行了广泛实证评估,发现 CAFIE 优于强基线,生成更公平的文本,并在公平性与语言建模能力间取得最佳平衡。
引用
@article{arxiv.2311.05451,
title = {All Should Be Equal in the Eyes of Language Models: Counterfactually Aware Fair Text Generation},
author = {Pragyan Banerjee and Abhinav Java and Surgan Jandial and Simra Shahid and Shaz Furniturewala and Balaji Krishnamurthy and Sumit Bhatia},
journal= {arXiv preprint arXiv:2311.05451},
year = {2023}
}
备注
The first four authors contributed equally to the work