中文

审计大型语言模型偏见的 PRISM 方法

计算与语言 2024-11-12 v2 人工智能 计算机与社会

摘要

审计大型语言模型(LLM)以发现其偏见和偏好是创建负责任人工智能(AI)的新兴挑战。尽管已提出 various 方法来诱导此类模型的偏好,但LLM训练师们已采取措施,使得LLM隐藏、混淆或直接拒绝披露其在某些主题上的立场。本文提出了PRISM,一种灵活的、基于任务的查询方法,用于审计LLM——通过任务式查询而非直接查询偏好来间接获取此类立场。为展示该方法的实用性,我们在政治 compass 测试上应用了PRISM,对来自七家供应商的21个LLM进行了政治倾向评估。我们表明LLM默认主张经济上左翼、社会上自由主义的立场(与既有工作相符)。我们还展示了这些模型愿意表达的立场范围——其中一些模型更受限制且不太合作,而另一些则更中立客观。在总体上,PRISM能够更可靠地探测和审计LLM以理解其偏好、偏见和限制。

关键词

引用

@article{arxiv.2410.18906,
  title  = {PRISM: A Methodology for Auditing Biases in Large Language Models},
  author = {Leif Azzopardi and Yashar Moshfeghi},
  journal= {arXiv preprint arXiv:2410.18906},
  year   = {2024}
}