置信度中的 Dropout:人类-LLM 对齐中的道德不确定性
人工智能
2025-11-18 v1 计算与语言
计算机与社会
摘要
人类在面对道德困境时表现出显著的不确定性,而这种不确定性在机器和人工智能代理中是否如此尚未得到充分探讨。最近的研究确认了机器生成响应的过度自信倾向,尤其是在大型语言模型 (LLM) 中。随着这些系统日益嵌入伦理决策场景,理解其道德推理及其内在不确定性对于构建可靠的人工智能系统至关重要。本文考察了不确定性如何影响经典坦拉沃问题中的道德决策,对32个开源模型和9个不同道德维度的响应进行分析。我们首先发现,模型置信度在不同模型之间的方差大于道德维度内部的方差,这表明道德不确定性主要受模型架构和训练方法的影响。为量化不确定性,我们将二进制熵测量为总熵、条件熵和互信息的线性组合。为检验其影响,我们通过在推理时引入“Dropout”来引入模型的随机性。我们的发现表明,该机制增加了总熵,主要通过增加互信息实现,而条件熵基本保持不变。此外,该机制显著提高了人类-LLM 道德对齐水平,置信度中的互信息与对齐得分变化呈相关性。我们的结果凸显了通过刻意调制不确定性、降低在道德复杂情境中 LLM 的自信度,从而更好地对齐模型生成的决策与人类偏好之间的潜力。
引用
@article{arxiv.2511.13290,
title = {Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment},
author = {Jea Kwon and Luiz Felipe Vecchietti and Sungwon Park and Meeyoung Cha},
journal= {arXiv preprint arXiv:2511.13290},
year = {2025}
}
备注
Accepted to AAAI 2026