中文

GenderAlign:用于减轻大型语言模型中性别偏见的人机对齐数据集

计算与语言 2024-12-17 v3 人工智能

摘要

大型语言模型(LLM)容易生成表现出性别偏见的内容,引发了重大的伦理担忧。对齐,即微调LLM以使其更好地与期望行为保持一致的过程,被认为是减轻性别偏见的有效方法。尽管专有LLM在减轻性别偏见方面取得了显著进展,但其对齐数据集并未公开。常用且公开可用的对齐数据集HH-RLHF仍然在一定程度上表现出性别偏见。目前缺乏专门为解决性别偏见而设计的公开可用对齐数据集。因此,我们开发了一个名为GenderAlign的新数据集,旨在减轻LLM中一系列全面的性别偏见。该数据集包含8k个单轮对话,每个对话都配有一个“选中”和一个“拒绝”的回复。与“拒绝”回复相比,“选中”回复表现出更低的性别偏见水平和更高的质量。此外,我们将GenderAlign中“拒绝”回复的性别偏见分为4个主要类别。实验结果表明,GenderAlign在减少LLM中的性别偏见方面是有效的。

关键词

引用

@article{arxiv.2406.13925,
  title  = {GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models},
  author = {Tao Zhang and Ziqian Zeng and Yuxiang Xiao and Huiping Zhuang and Cen Chen and James Foulds and Shimei Pan},
  journal= {arXiv preprint arXiv:2406.13925},
  year   = {2024}
}