衡量大语言模型中的道德不一致性
计算与语言
2024-03-04 v3 机器学习
摘要
如果语义等价的提示产生语义等价的响应,则认为大语言模型(Large Language Model, LLM)具有一致性。尽管最近的进展展示了 LLM 在对话系统中的卓越能力,但我们表明,即使是最先进的 LLM 在其生成中也高度不一致,这对其可靠性提出了质疑。先前的研究试图通过特定任务的准确性来衡量这一点。然而,这种方法不适用于没有“正确”答案的道德场景,如电车难题。为解决这一问题,我们提出了一种新的信息论度量方法,称为语义图熵(Semantic Graph Entropy, SGE),用于衡量 LLM 在道德场景中的一致性。我们利用“经验法则”(Rules of Thumb, RoTs)来解释模型的决策策略,并进一步增强我们的度量指标。与现有的一致性指标相比,SGE 在五个 LLM 上与人类判断的相关性更好。未来,我们旨在调查 LLM 不一致性的根本原因并提出改进方案。
引用
@article{arxiv.2402.01719,
title = {Measuring Moral Inconsistencies in Large Language Models},
author = {Vamshi Krishna Bonagiri and Sreeram Vennam and Manas Gaur and Ponnurangam Kumaraguru},
journal= {arXiv preprint arXiv:2402.01719},
year = {2024}
}
备注
Accepted at BlackBoxNLP 2023, Co-located with EMNLP 2023