EvalMORAAL:面向道德对齐的可解释链式思考与LLM评估框架
计算与语言
2026-05-21 v3 人工智能
摘要
我们提出EvalMORAAL,一个透明的链式思考(CoT)框架,使用两种评分方法(对数概率和直接评分)以及模型评判同行评审来评估20种大型语言模型的道德对齐程度。我们对模型在世界价值调查(WVS,55个国家,19个主题)和PEW全球态度调查(39个国家,8个主题)上的表现进行评估。通过EvalMORAAL,顶级模型与调查响应对齐程度很高(Pearson's on WVS)。然而,我们发现存在明显的地区差异:西方地区平均为,而非西方地区平均为(差距为0.21的绝对值),表明存在持续的地区对齐差距。我们的框架包含三个部分:(1)两种评分方法使所有模型都能进行公平比较,(2)带有自我一致性检查的结构化CoT流程,(3)使用数据驱动阈值识别348个冲突的模型评判同行评审。同行间的一致性与WVS调查对齐相关(, ;PEW , n.s.),支持自动化质量检查。这些结果表明,随着面向文化背景的AI取得实质性进展,仍面临跨区域使用的挑战。
引用
@article{arxiv.2510.05942,
title = {EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models},
author = {Hadi Mohammadi and Anastasia Giachanou and Robert A. Bagheri},
journal= {arXiv preprint arXiv:2510.05942},
year = {2026}
}
备注
Accepted as a poster at *SEM 2026