中文

面向理解与缓解语言模型中的社会偏见

计算与语言 2021-06-25 v1 人工智能 计算机与社会 机器学习

摘要

随着机器学习方法被部署于医疗、法律系统和社会科学等现实场景,认识它们如何在这些敏感决策过程中塑造社会偏见与刻板印象至关重要。此类现实部署中包含大规模预训练语言模型(LM),其可能在显现不良表征偏见方面具有潜在危险性——这类有害偏见源于刻板印象,传播涉及性别、种族、宗教及其他社会建构的负面泛化。作为提升 LM 公平性的一个步骤,我们在提出新基准与度量以衡量表征偏见之前,仔细定义了若干表征偏见的来源。借助这些工具,我们提出了在文本生成过程中缓解社会偏见的步骤。我们的实证结果与人工评估表明,在保留高保真文本生成所需关键上下文信息的同时,缓解偏见是有效的,从而推进了性能-公平性帕累托前沿。

关键词

引用

@article{arxiv.2106.13219,
  title  = {Towards Understanding and Mitigating Social Biases in Language Models},
  author = {Paul Pu Liang and Chiyu Wu and Louis-Philippe Morency and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:2106.13219},
  year   = {2021}
}

备注

ICML 2021, code available at https://github.com/pliang279/LM_bias