中文

我们应更多还是更少地关注?调制注意力以实现公平性

计算与语言 2024-08-06 v2 人工智能 计算机与社会 机器学习

摘要

自然语言处理(NLP)的进展既带来机遇也带来挑战。虽然近期的进展使得能够为各种任务开发高性能模型,但也带来了模型从数据中学习有害偏见(如性别刻板印象)的风险。在这项工作中,我们研究了注意力(当前最先进 NLP 模型中广泛使用的一种技术)在社会偏见传播中的作用。具体而言,我们研究了注意力分布的熵与模型性能和公平性之间的关系。然后我们提出了一种在训练后调制注意力权重以改善模型公平性的新方法。由于我们的方法仅应用于训练后和推理前,它是一种内部处理方法(intra-processing method),因此比现有的处理中(in-processing)和预处理(pre-processing)方法计算开销更小。我们的结果显示,在使用不同规模语言模型的不同文本分类和生成任务上,公平性得到提升且性能损失极小。警告:本工作使用了冒犯性语言。

关键词

引用

@article{arxiv.2305.13088,
  title  = {Should We Attend More or Less? Modulating Attention for Fairness},
  author = {Abdelrahman Zayed and Goncalo Mordido and Samira Shabanian and Sarath Chandar},
  journal= {arXiv preprint arXiv:2305.13088},
  year   = {2024}
}

备注

In Proceedings of Conference on Language Modeling (COLM 2024)