中文

无监督从语言模型中挖掘道德价值观

计算与语言 2026-01-27 v1

摘要

随着AI系统的普及,依托人类价值观来引导其行为至关重要。先前的工作表明,语言模型(LM)仅具备有限的内在道德推理能力,致使人们呼吁进行明确的道德教学。然而,由于多元化的道德框架和普遍的偏见,构建道德评估的真实数据困难重重。我们研究无监督挖掘作为替代方案,探讨预训练(基础)语言模型是否拥有可被无需人工监督揭示的内在道德推理能力。我们采用Internal Coherence Maximization (ICM)算法,对三个基准数据集和四个语言模型进行测试,检验ICM是否可靠地标记道德判断、跨框架推广以及缓解社会偏见。结果表明,ICM在Norm Bank和ETHICS基准上超越所有预训练和聊天机器人基线,而且对ICM标签的微调在性能上与人工标签相当或更好。在理论上激发的道德框架中,ICM在正义和常识道德方面的相对提升最大。此外,尽管聊天语言模型在社会偏见失败率上与其预训练模型相当,ICM可将此类错误减少超过一半,在种族、社会经济地位和政治方面的改进尤为显著。这些发现表明,预训练语言模型具备可通过无监督方法如ICM挖掘的潜在道德推理能力,为AI对齐提供了可扩展的路径。

关键词

引用

@article{arxiv.2601.17728,
  title  = {Unsupervised Elicitation of Moral Values from Language Models},
  author = {Meysam Alizadeh and Fabrizio Gilardi and Zeynab Samei},
  journal= {arXiv preprint arXiv:2601.17728},
  year   = {2026}
}