中文

通过模型自适应的去偏算法

计算与语言 2024-05-30 v4 人工智能 机器学习

摘要

大型语言模型正成为应对日益增长的大量任务的首选方案。然而,随着容量增长,模型易于依赖源自训练数据中存在的偏见和刻板印象的虚假相关性。本工作提出了一种检测和缓解语言模型中性别偏见的新方法。我们进行因果分析以识别有问题的模型组件,并发现中上层前馈层最容易传递偏见。基于分析结果,我们通过向这些层的权重矩阵应用线性投影来干预模型。我们的同名方法 DAMA 显著降低了由多种指标衡量的偏见,同时保持了模型在下游任务上的性能。我们发布了我们的方法和模型的代码,其在显著更少偏见的同时保持了 LLaMA 的最先进性能。

关键词

引用

@article{arxiv.2310.18913,
  title  = {Debiasing Algorithm through Model Adaptation},
  author = {Tomasz Limisiewicz and David Mareček and Tomáš Musil},
  journal= {arXiv preprint arXiv:2310.18913},
  year   = {2024}
}

备注

Accepted to ICLR 2024