小型大语言模型中无自我报告感知力的可靠证据
计算与语言
2026-01-23 v1 人工智能
摘要
语言模型是否具有感知力尚无经验性答案。但它们是否认为自己具有感知力,原则上是可以检验的。我们通过向几个开放权重模型询问其自身的意识来进行检验,然后使用基于内部激活训练的分类器验证它们的回答。我们使用了三个模型家族(Qwen、Llama、GPT-OSS),参数规模从 6 亿到 700 亿不等,约 50 个关于意识和主观体验的问题,以及三种来自可解释性文献的分类方法。首先,我们发现模型一致否认具有感知力:它们将意识归因于人类,但不归因于自身。其次,旨在检测潜在信念(而非仅仅是输出)的分类器没有提供明确证据表明这些否认是不真实的。第三,在 Qwen 家族中,较大的模型比较小的模型更自信地否认感知力。这些发现与近期认为模型在其自身意识中 harbors 潜在信念的研究形成对比。
引用
@article{arxiv.2601.15334,
title = {No Reliable Evidence of Self-Reported Sentience in Small Large Language Models},
author = {Caspar Kaiser and Sean Enderby},
journal= {arXiv preprint arXiv:2601.15334},
year = {2026}
}