中文

使用大型语言模型检测政府文件中的语言偏见

计算与语言 2025-02-20 v1

摘要

本文探讨了检测政府文件中偏见的关键需求,这是一个对治理具有重大影响且尚未被充分探索的领域。现有方法通常忽视了政府文件的独特语境和深远影响,可能会掩盖影响公共政策和公民与政府互动的潜在偏见。为了弥合这一差距,我们引入了用于偏见检测的荷兰政府数据集(DGDB),该数据集来源于荷兰众议院并由专家进行偏见标注。我们在该数据集上微调了多个基于 BERT 的模型,并将其性能与生成式语言模型进行了比较。此外,我们进行了全面的错误分析,包括对模型预测的解释。我们的研究结果表明,微调模型取得了强劲的性能并显著优于生成式语言模型,表明 DGDB 在偏见检测方面的有效性。本研究强调了带标注数据集对于不同语言偏见检测的重要性,并有助于促进更公平的治理实践。

关键词

引用

@article{arxiv.2502.13548,
  title  = {Detecting Linguistic Bias in Government Documents Using Large language Models},
  author = {Milena de Swart and Floris den Hengst and Jieying Chen},
  journal= {arXiv preprint arXiv:2502.13548},
  year   = {2025}
}

备注

to appear in Proceedings of the ACM Web Conference 2025