中文

从偏见到平衡:去除大语言模型词嵌入的新方法

计算与语言 2025-01-08 v6 计算机与社会

摘要

嵌入在大语言模型效果中的起着关键作用。它们是这些模型理解语境关系、更深入地理解语言并在大量需要对人类语言基本理解的复杂任务上表现出色的基石。鉴于这些嵌入本身常常反映或呈现偏见,这些模型也可能不慎地学习这种偏见。本文基于半导体性的前期工作,提出 DeepSoftDebias 算法,该算法使用神经网络执行“软去偏”。我们在广泛的 SOTA 数据集、准确度指标和具有挑战性的 NLP 任务上全面评估了该算法。我们发现 DeepSoftDebias 在消除性别、种族和宗教偏见方面优于当前最先进的方法。

关键词

引用

@article{arxiv.2402.11512,
  title  = {From Prejudice to Parity: A New Approach to Debiasing Large Language Model Word Embeddings},
  author = {Aishik Rakshit and Smriti Singh and Shuvam Keshari and Arijit Ghosh Chowdhury and Vinija Jain and Aman Chadha},
  journal= {arXiv preprint arXiv:2402.11512},
  year   = {2025}
}

备注

Accepted at COLING 2025