中文

做正确的事,只需去偏!使用 LLM 缓解多类别偏见

计算与语言 2024-09-26 v1

摘要

本文探讨了为语言构建鲁棒且可泛化的偏见缓解模型的挑战。认识到现有数据集的局限性,我们引入了 ANUBIS,一个包含 1507 对精心挑选的句子对的新颖数据集,涵盖九个社会偏见类别。我们评估了 T5 等最先进的模型,利用监督微调(SFT)、强化学习(PPO、DPO)和上下文学习(ICL)来有效缓解偏见。我们的分析侧重于多类别社会偏见减少、跨数据集泛化能力以及训练模型的环境影响。ANUBIS 和我们的发现为构建更公平的 AI 系统提供了宝贵资源,并有助于开发具有广泛社会影响的负责任且无偏见的技术。

关键词

引用

@article{arxiv.2409.16371,
  title  = {Do the Right Thing, Just Debias! Multi-Category Bias Mitigation Using LLMs},
  author = {Amartya Roy and Danush Khanna and Devanshu Mahapatra and Vasanthakumar and Avirup Das and Kripabandhu Ghosh},
  journal= {arXiv preprint arXiv:2409.16371},
  year   = {2024}
}

备注

17 pages, 5 Figures