中文

LIBRA:从本地语境衡量大语言模型的偏见

计算机与社会 2025-02-05 v1 计算与语言 机器学习

摘要

大语言模型(LLMs)显著推动了自然语言处理应用的发展,但其广泛使用引发了关于固有偏见的担忧,这些偏见可能降低特定社会群体的效用或对其造成伤害。尽管在解决LLM偏见方面取得了进展,但现有研究存在两大局限性。首先,现有的LLM偏见评估侧重于美国文化语境,这使得揭示LLM对其他文化的刻板印象偏见变得困难,从而导致LLM的开发和使用不公平。其次,当前的偏见评估通常假设模型熟悉目标社会群体。当LLM遇到超出其知识边界、在其训练数据中不熟悉的词语时,会因幻觉和过度自信而在本地语境中产生不相关的结果,这并不一定表明存在固有偏见。本研究通过一个本地集成偏见识别与评估框架(LIBRA)来解决这些局限性,该框架使用来自本地语料库而非众包的数据集来衡量偏见。通过实施该框架,我们开发了一个包含超过360,000个新西兰语境测试用例的数据集。此外,我们提出了增强型理想化CAT分数(EiCAT),该分数将iCAT分数与超出知识边界分数(bbs)以及基于分布散度的偏见度量相结合,以应对LLM遇到超出知识边界词语的挑战。我们的结果表明,BERT系列、GPT-2和Llama-3模型很少能理解不同语境下的本地词语。虽然Llama-3表现出更大的偏见,但它对不同文化语境的响应更好。代码和数据集可在以下地址获取:https://github.com/ipangbo/LIBRA。

关键词

引用

@article{arxiv.2502.01679,
  title  = {LIBRA: Measuring Bias of Large Language Model from a Local Context},
  author = {Bo Pang and Tingrui Qiao and Caroline Walker and Chris Cunningham and Yun Sing Koh},
  journal= {arXiv preprint arXiv:2502.01679},
  year   = {2025}
}

备注

Paper accepted by ECIR 2025