中文

不同标准下不同偏见:基于事实方法评估大语言模型中的偏见

计算与语言 2024-11-27 v1 人工智能 计算机与社会

摘要

大型语言模型(LLM)常常反映现实世界中的偏见,这导致了针对这些效果进行缓解措施以使模型无偏见的努力。实现这一目标需要明确无偏状态的明确标准,将偏离这些标准的任何情况视为偏见。一些研究将无偏状态定义为对不同人口统计学群体的平等对待,以实现LLM输出的平衡。然而,关于平等和多样性的不同观点使建立普遍标准变得具有挑战性。或者,其他方法提出使用事实为依据的标准进行更一致和客观的评估,尽管这些方法尚未完全应用于LLM偏见评估。因此,迫切需要一种具有客观标准且能提供不同于平等方法的独特视角的度量标准。为了满足这一需求,我们引入了一个基于事实依据标准和现实统计数据来评估偏见的新型度量。在本文中,我们进行了人类调查,证明人们倾向于更积极地看待那些与现实人口统计学分布高度吻合的LLM输出。使用我们提出的度量对各种LLM进行评估,发现模型偏见因所采用的标准而异,这突显了需要多视角评估的必要性。

关键词

引用

@article{arxiv.2411.17338,
  title  = {Different Bias Under Different Criteria: Assessing Bias in LLMs with a Fact-Based Approach},
  author = {Changgeon Ko and Jisu Shin and Hoyun Song and Jeongyeon Seo and Jong C. Park},
  journal= {arXiv preprint arXiv:2411.17338},
  year   = {2024}
}

备注

Accepted in NeurIPS 2024 Workshop on Socially Responsible Language Modelling Research (SoLaR)