中文

通过强化校准缓解语言模型中的政治偏见

计算与语言 2021-05-03 v1 人工智能

摘要

当前的大规模语言模型可能因训练数据而带有政治偏见,在真实场景部署时可能引发严重问题。本文描述了用于度量 GPT-2 生成中政治偏见的指标,并提出了一种强化学习(RL)框架以缓解生成文本中的政治偏见。通过利用词嵌入或分类器给出的奖励,我们的 RL 框架在无法访问训练数据且无需重新训练模型的情况下引导去偏生成。在三个对政治偏见敏感的属性(性别、地点和话题)上的实证实验中,根据我们的指标和人工评估,我们的方法在保持可读性与语义连贯性的同时降低了偏见。

关键词

引用

@article{arxiv.2104.14795,
  title  = {Mitigating Political Bias in Language Models Through Reinforced Calibration},
  author = {Ruibo Liu and Chenyan Jia and Jason Wei and Guangxuan Xu and Lili Wang and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2104.14795},
  year   = {2021}
}

备注

In proceedings of the 35th AAAI Conference on Artificial Intelligence