中文

量化大语言模型的风险倾向:通过角色扮演聚焦伦理与检测偏见

计算机与社会 2025-05-09 v2 人工智能 计算与语言

摘要

随着大语言模型(LLM)日益普及,关于其安全性、伦理和潜在偏见的担忧也随之上升。系统性评估LLM的风险决策倾向和态度,特别是在伦理领域,变得至关重要。本研究创新性地将认知科学中的领域特定冒险量表(DOSPERT)应用于LLM,并提出了一种新颖的伦理决策风险态度量表(EDRAS),以深入评估LLM的伦理风险态度。我们进一步提出了一种结合风险量表与角色扮演的新方法,以定量评估LLM的系统性偏见。通过对多个主流LLM的系统性评估和分析,我们跨多个领域评估了LLM的“风险人格”,特别聚焦于伦理领域,并揭示并量化了LLM对不同群体的系统性偏见。该研究有助于理解LLM的风险决策,确保其安全可靠的应用。我们的方法为识别和缓解偏见提供了工具,有助于构建更公平、更可信的AI系统。代码和数据已公开。

关键词

引用

@article{arxiv.2411.08884,
  title  = {Quantifying Risk Propensities of Large Language Models: Ethical Focus and Bias Detection through Role-Play},
  author = {Yifan Zeng and Liang Kairong and Fangzhou Dong and Peijia Zheng},
  journal= {arXiv preprint arXiv:2411.08884},
  year   = {2025}
}

备注

Accepted by CogSci 2025