中文

弥合公平性差距:利用 LLM 生成的句子增强预训练模型

计算与语言 2025-03-13 v1 人工智能

摘要

预训练语言模型(PLMs)在固有包含性别偏见的数据上训练,导致了不良影响。传统的去偏方法通常依赖外部语料库,这些语料库可能缺乏质量、多样性或人口统计学平衡,从而影响去偏的有效性。随着大语言模型及其广博知识的兴起,我们提出通过吸收连贯、属性平衡且语义丰富的句子来增强 PLMs 的公平性(Fair-Gender)。然而,由于对齐问题和负迁移风险,这些句子不能直接用于去偏。我们通过应用因果分析来估计因果效应以解决这一问题,滤除未对齐的句子,并识别出已对齐的句子以将其纳入 PLMs,从而确保正迁移。实验表明,我们的方法在保持 PLMs 语言表达能力的同时,显著减少了其中的性别偏见。

关键词

引用

@article{arxiv.2501.06795,
  title  = {Bridging the Fairness Gap: Enhancing Pre-trained Models with LLM-Generated Sentences},
  author = {Liu Yu and Ludie Guo and Ping Kuang and Fan Zhou},
  journal= {arXiv preprint arXiv:2501.06795},
  year   = {2025}
}