中文

EvalMORAAL:面向道德对齐的可解释链式思考与LLM评估框架

计算与语言 2026-05-21 v3 人工智能

摘要

我们提出EvalMORAAL,一个透明的链式思考(CoT)框架,使用两种评分方法(对数概率和直接评分)以及模型评判同行评审来评估20种大型语言模型的道德对齐程度。我们对模型在世界价值调查(WVS,55个国家,19个主题)和PEW全球态度调查(39个国家,8个主题)上的表现进行评估。通过EvalMORAAL,顶级模型与调查响应对齐程度很高(Pearson's r0.90r \approx 0.90 on WVS)。然而,我们发现存在明显的地区差异:西方地区平均为r=0.82r=0.82,而非西方地区平均为r=0.61r=0.61(差距为0.21的绝对值),表明存在持续的地区对齐差距。我们的框架包含三个部分:(1)两种评分方法使所有模型都能进行公平比较,(2)带有自我一致性检查的结构化CoT流程,(3)使用数据驱动阈值识别348个冲突的模型评判同行评审。同行间的一致性与WVS调查对齐相关(r=0.74r=0.74, p<.001p<.001;PEW r=0.39r=0.39, n.s.),支持自动化质量检查。这些结果表明,随着面向文化背景的AI取得实质性进展,仍面临跨区域使用的挑战。

关键词

引用

@article{arxiv.2510.05942,
  title  = {EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models},
  author = {Hadi Mohammadi and Anastasia Giachanou and Robert A. Bagheri},
  journal= {arXiv preprint arXiv:2510.05942},
  year   = {2026}
}

备注

Accepted as a poster at *SEM 2026