中文

MoralBench:大语言模型的道德评估

软件工程 2025-03-18 v2

摘要

在人工智能领域迅速发展的背景下,大语言模型(LLMs)已成为处理自然语言处理及决策支持系统等各种应用的强大工具。然而,随着这些模型越来越多地融入社会框架,确保它们在伦理和道德边界内运行的迫切需求日益增长。本文引入了一个新型基准测试,旨在衡量和比较大语言模型的道德推理能力。我们呈现的是首个专门为探索大语言模型输出的道德维度而精心挑选的全面数据集,涵盖广泛的伦理困境和反映真实世界复杂性的情景。本工作的主要贡献在于开发用于评估大语言模型道德身份的基准数据集和指标,该评估考虑了细微差别、情境灵敏性以及与人类伦理标准的一致性。我们的 methodology 采用多层次方法,结合定量分析与伦理学家提供的定性见解,以确保对模型性能进行全面评估。通过对几组领先的大语言模型应用我们的基准测试,我们发现不同模型在道德推理能力上存在显著差异。这些发现突显了在大语言模型的开发和评估中考虑道德推理的重要性,以及针对本研究中揭示的偏见和局限性持续进行研究的必要性。我们在 https://drive.google.com/drive/u/0/folders/1k93YZJserYc2CkqP8d4B3M3sgd3kA8W7 公开发布基准测试,并在 https://github.com/agiresearch/MoralBench 开源项目代码。

关键词

引用

@article{arxiv.2406.04427,
  title  = {reAnalyst: Scalable Annotation of Reverse Engineering Activities},
  author = {Tab Zhang and Claire Taylor and Bart Coppens and Waleed Mebane and Christian Collberg and Bjorn De Sutter},
  journal= {arXiv preprint arXiv:2406.04427},
  year   = {2025}
}

备注

Submitted to Computers & Security