中文

超越人类判断:对大语言模型道德价值理解的贝叶斯评估

计算与语言 2025-11-24 v3 人机交互

摘要

大语言模型(LLM)在道德维度上如何理解人类?本次首次大规模贝叶斯评估市场领先的语言模型提供了答案。与以确定性真实值(多数投票或包含规则)的先前工作不同,我们建模了标注员之间的 disagreement,以捕捉两类不确定性: aleatoric 不确定性(固有的 human disagreement)和 epistemic 不确定性(模型对 domain 的敏感性)。我们评估了最好的语言模型(Claude Sonnet 4、DeepSeek-V3、Llama 4 Maverick),其在 250 万+ 注释、来自近 700 名标注员、覆盖社交网络、新闻和论坛等 100 万+ 文本上的评估中表现如何。我们的 GPU 优化贝叶斯框架处理了 100 万+ 模型查询,揭示 AI 模型通常位于人类标注员前 25%,在平均平衡准确率方面表现远佳。重要的是,我们发现 AI 比人类产生了更多的 false negative,凸显其更敏感的道德检测能力。

关键词

引用

@article{arxiv.2508.13804,
  title  = {Beyond Human Judgment: A Bayesian Evaluation of LLMs' Moral Values Understanding},
  author = {Maciej Skorski and Alina Landowska},
  journal= {arXiv preprint arXiv:2508.13804},
  year   = {2025}
}

备注

Appears in UncertaiNLP@EMNLP 2025