SaGE:评估大语言模型中的道德一致性
计算与语言
2024-03-11 v2 人工智能
摘要
尽管近期取得的进展显示出大语言模型(LLM)在对话系统中的惊人能力,但我们指出即便是最先进的 LLM 在生成过程中也存在道德不一致性,这质疑了其可靠性(以及更广泛的可信度)。先前的工作侧重于开发基准数据来衡量特定任务的准确性。然而,对于常缺乏普遍共识答案的道德情境而言,模型响应的一致性对于其可靠性至关重要。为此,我们提出一种基于信息论度量的语义图熵(SaGE)度量方法,grounded in the concept of "Rules of Thumb"(RoTs)来衡量模型的道德一致性。RoTs 是由模型学习的抽象原则,可有效帮助解释其决策策略。为此,我们构建了道德一致性语料库(MCC),包含 5 万个道德问题、LLM 对这些问题的响应,以及这些模型所遵循的 RoTs。此外,为说明 SaGE 的通用性,我们将其用于调查 LLM 在两个流行数据集上的一致性——TruthfulQA 和 HellaSwag。我们的结果揭示,任务准确性与一致性是独立的问题,迫切需要进一步调查这些问题。
引用
@article{arxiv.2402.13709,
title = {SaGE: Evaluating Moral Consistency in Large Language Models},
author = {Vamshi Krishna Bonagiri and Sreeram Vennam and Priyanshul Govil and Ponnurangam Kumaraguru and Manas Gaur},
journal= {arXiv preprint arXiv:2402.13709},
year = {2024}
}
备注
Accepted at LREC-COLING 2024