中文

没有任何 LLM 免于偏见:大语言模型偏差评估的全面研究

计算与语言 2025-05-28 v2 人工智能

摘要

大语言模型(LLM)的进步提升了不同自然语言理解与生成任务的性能。尽管 LLMs 在各类任务中已突破了最先进水平,但它们往往反映出训练数据中不同形式的偏见。基于此 perceived 的局限性,我们提供了一项统一评估,使用一组代表性的小型和中型 LLMs 覆盖从物理特征到社会经济类别的各种偏见形式。此外,我们提出了五种提示方法,以跨不同偏见方面进行偏差检测。我们进一步提出三个研究问题,以获得在不同方法和评估指标下检测 LLMs 中偏见的有价值见解。结果表明,所选的每个 LLM 都受到某种形式的偏见影响,Phi-3.5B 模型则是偏见最少的。最后,我们以识别关键挑战和可能的未来方向为结论。

关键词

引用

@article{arxiv.2503.11985,
  title  = {No LLM is Free From Bias: A Comprehensive Study of Bias Evaluation in Large Language Models},
  author = {Charaka Vinayak Kumar and Ashok Urlana and Gopichand Kanumolu and Bala Mallikarjunarao Garlapati and Pruthwik Mishra},
  journal= {arXiv preprint arXiv:2503.11985},
  year   = {2025}
}

备注

12 pages, 1 figure