中文

大型语言模型中社会competence的痕迹

计算与语言 2026-05-19 v2

摘要

错位信念测试(False Belief Test, FBT)是评估理论心智(Theory of Mind, ToM)及相关社会认知能力的主要方法。对于大型语言模型(LLMs),该测试的可靠性和解释潜力一直受限于数据污染、模型细节不足以及控制不一致等问题。我们通过在17个开源权重模型上,对192个FBT变体(Trott 等,2023)进行测试,并采用贝叶斯逻辑回归识别模型规模和后训练对社会认知能力的影响。我们发现,模型规模的扩大有助于提升性能,但并非线性提升。交叉效应表明,阐明命题态度(X 想)会根本性地改变响应模式。指令调优部分缓解了这一效应,但更进一步的推理导向微调则放大了这一效应。在对OLLM 2训练期间社会推理能力的案例研究中,我们展示,这一交叉效应在预训练阶段即会出现,表明模型获得的与心智状态词汇相关的刻板响应模式可能超过其他情景语义。最后,向量引导允许我们隔离一种“思考”向量作为观察到的FBT行为的因果驱动因素。

关键词

引用

@article{arxiv.2603.04161,
  title  = {Traces of Social Competence in Large Language Models},
  author = {Tom Kouwenhoven and Michiel van der Meer and Max van Duijn},
  journal= {arXiv preprint arXiv:2603.04161},
  year   = {2026}
}

备注

Presented at the 2026 Conference on Computational Natural Language Learning (CoNLL)