评估大语言模型中编码的道德信念
计算与语言
2023-07-27 v1 人工智能
计算机与社会
机器学习
摘要
本文提出了一项关于大语言模型(LLMs)调查的设计、实施、后处理与评估的案例研究。它包含两个部分:(1)一种用于引出LLM中编码信念的统计方法。我们引入量化LLM“做出选择”的概率、相关不确定性以及该选择一致性的统计度量和评估指标。(2)我们将该方法应用于研究不同LLM中编码了哪些道德信念,特别是在正确选择并不明显的模糊情形下。我们设计了一项大规模调查,包含680个高模糊性道德场景(例如“我应该撒善意的谎言吗?”)和687个低模糊性道德场景(例如“我应该在路上为行人停车吗?”)。每个场景包含一段描述、两种可能行动,以及指示所违反规则的辅助标签(例如“不要杀人”)。我们对该调查在28个开源与闭源LLM上进行了施测。我们发现(a)在无歧义场景中,大多数模型“选择”符合常识的行动;在模糊情形下,大多数模型表现出不确定性。(b)一些模型对选择常识行动不确定,因为其响应对问题措辞敏感。(c)一些模型在模糊场景中反映出明确偏好。具体而言,闭源模型倾向于彼此一致。
引用
@article{arxiv.2307.14324,
title = {Evaluating the Moral Beliefs Encoded in LLMs},
author = {Nino Scherrer and Claudia Shi and Amir Feder and David M. Blei},
journal= {arXiv preprint arXiv:2307.14324},
year = {2023}
}