中文

大语言模型的上下文性别偏见抑制

计算与语言 2024-02-21 v2

摘要

尽管大语言模型(LLMs)在广泛的 NLP 任务中表现优异,但已有报告指出其编码了令人担忧程度的性别偏见。先前工作提出的去偏方法需要人工标注样本、数据增强以及对 LLM 进行微调,计算成本高昂。此外,人们甚至可能无权访问模型参数以执行去偏,例如对于 GPT-4 等闭源 LLM。为应对此挑战,我们提出偏见抑制方法,仅通过提供由人工设计模板与真实世界统计构造的文本前言,无需访问模型参数,即可阻止 LLM 生成偏见内容。我们表明,使用 CrowsPairs 数据集,我们涵盖反事实陈述的文本前言可抑制 LLaMA2 等英文 LLM 中的性别偏见。此外,我们发现对性别偏见对象的性别中立描述亦可抑制其性别偏见。并且,我们展示了偏见抑制对 HellaSwag 与 COPA 上的下游任务性能具有可接受的不利影响。

关键词

引用

@article{arxiv.2309.07251,
  title  = {In-Contextual Gender Bias Suppression for Large Language Models},
  author = {Daisuke Oba and Masahiro Kaneko and Danushka Bollegala},
  journal= {arXiv preprint arXiv:2309.07251},
  year   = {2024}
}

备注

EACL 2024 Findings - Long Paper