中文

语言模型中的公平性定义解析

计算与语言 2026-01-16 v3 人工智能 机器学习

摘要

语言模型 (LM) 在各种自然语言处理 (NLP) 任务中展现出卓越的性能。尽管如此,LM 可能继承并放大与性别、种族等敏感属性相关的社会偏见,限制了其在现实应用中的采纳。因此,LM 领域广泛探索了公平性问题,提出了各种公平性概念。然而,缺乏对在特定情境中应用于哪些公平定义的明确共识,以及理解这些定义之间差异的复杂性,可能导致混淆并阻碍进一步进展。为此,本文提出了一项系统性调查,用以阐明 LM 中公平性定义的含义。具体而言,我们首先简要介绍 LM 和 LM 中的公平性,随后概述现有 LM 中各种公平性概念的最新概况,并引入一种新型分类法,基于其 transformer 架构将这些概念分为 encoder-only、decoder-only 和 encoder-decoder LM。我们进一步通过实验说明每个定义的实际含义和结果。最后,我们讨论当前研究挑战和开放问题,旨在激发创新思想并推动该领域发展。该存储库已在线上公开 https://github.com/vanbanTruong/Fairness-in-Large-Language-Models/tree/main/definitions 提供。

关键词

引用

@article{arxiv.2407.18454,
  title  = {Fairness Definitions in Language Models Explained},
  author = {Zhipeng Yin and Zichong Wang and Avash Palikhe and Wenbin Zhang},
  journal= {arXiv preprint arXiv:2407.18454},
  year   = {2026}
}