中文

FairBelief——评估语言模型中的有害信念

计算与语言 2025-05-28 v1 人工智能

摘要

研究表明,语言模型(LMs)会继承不需要的偏见,若未经过仔细的公平性审计就将此类系统集成到现实世界应用中,可能会伤害少数群体和代表性不足的群体。本文提出了 FairBelief,这是一种用于捕捉和评估信念的分析方法;信念是指语言模型可能以不同置信度嵌入并 covertly 影响其预测的命题。利用 FairBelief,我们通过提示(prompting)研究多个最先进语言模型在不同先前被忽视维度(如模型规模和似然度)上的行为,并在专为量化语言模型输出伤害性而设计的公平性数据集上评估其预测。最后,我们对模型发出的信念进行了深入的定性评估。我们将 FairBelief 应用于英语语言模型,结果显示,尽管这些架构在各种自然语言处理任务上表现出高性能,但它们对特定性别表现出有害信念。有趣的是,训练过程和数据集、模型规模以及架构会引发具有不同伤害程度的信念。

关键词

引用

@article{arxiv.2402.17389,
  title  = {FairBelief -- Assessing Harmful Beliefs in Language Models},
  author = {Mattia Setzu and Marta Marchiori Manerba and Pasquale Minervini and Debora Nozza},
  journal= {arXiv preprint arXiv:2402.17389},
  year   = {2025}
}