追溯大语言模型中的道德基础
计算与语言
2026-05-20 v3 人工智能
摘要
大语言模型经常产生类似人类的道德判断,但尚不清楚这反映的是内部的概念结构还是表面的“道德模仿”。我们以道德基础理论 (MFT) 作为分析框架,研究了道德基础在14个基础型和指令微调型大语言模型(LLM)中是如何被编码、组织和表达的,这些模型涵盖四个模型家族 (Llama, Qwen2.5, Qwen3-MoE, Mistral) 且规模从7B到70B不等。我们采用了一种多层次方法,结合了 (i) 对MFT概念表征及其与人类道德感知一致性的逐层分析,(ii) 在残差流上使用预训练的稀疏自编码器 (SAE) 来识别支持道德概念的稀疏特征,以及 (iii) 使用密集MFT向量和稀疏SAE特征进行因果引导干预。我们发现,模型以与人类判断一致的方式表征和区分道德基础,并且这种道德几何结构自然地从预训练中涌现,并通过后训练被选择性地重构。在更精细的尺度上,SAE特征显示出与特定基础的清晰语义联系,表明在共享表征中存在部分解耦的机制。最后,沿着密集向量或稀疏特征进行引导,会在与基础相关的行为中产生可预测的转变,证明了内部表征与道德输出之间的因果关系。总之,我们的结果提供了机制性证据,表明大语言模型中的道德概念是分布式的、分层的且部分解耦的,这暗示多元化的道德结构可以仅从语言的统计规律中作为一种潜在模式涌现出来。
引用
@article{arxiv.2601.05437,
title = {Tracing Moral Foundations in Large Language Models},
author = {Chenxiao Yu and Bowen Yi and Farzan Karimi-Malekabadi and Suhaib Abdurahman and Jinyi Ye and Shrikanth Narayanan and Yue Zhao and Morteza Dehghani},
journal= {arXiv preprint arXiv:2601.05437},
year = {2026}
}