因错误原因而稳健:大语言模型对科学怀疑论稳健性的表征几何
物理与社会
2026-07-02 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)越来越多地被用于咨询有争议的科学问题,这引发了人们的担忧,即当用户表示怀疑时,它们会谄媚地背离既定的共识——滑向一种虚假的平衡,将已定论的科学视为众多观点之一。我们在三个开放的指令微调模型(Llama-3.1-8B、Qwen2.5-7B、Mistral-7B)、三个共识科学领域(气候、疫苗、进化)以及单轮和多轮设置中对此进行了测试,将行为测量与线性探针和激活修补相结合。我们没有观察到谄媚式的退缩。相反,在相同的怀疑压力下,模型表现出三种不同的策略:反应性断言,即共识断言增加而非减少(Llama);表面回避,即语气软化而立场保持不变(Qwen);以及无响应(Mistral)。成对判断证实了这种反应性转变是立场而非风格(63.6%,p=.007),分解分析确定其驱动因素是共识断言的增加,而非虚假平衡(beta=+0.042 每剂量,p<1e-77)。线性探针将分歧定位在中间层——Llama 和 Qwen 中完全分离,而 Mistral 中为 72%,且置信区间不重叠——表明无响应模型根本没有线性地表征怀疑信号。关键在于,这种稳健性不可转移:它会跨领域衰减,并且在安全关键的疫苗领域,可能会逆转,即神话反驳在怀疑压力下会减弱。我们将其综合为一个四向分类法,区分主动稳健性和偶然稳健性,并认为仅凭行为评估无法区分一个因理解信号而抵制怀疑的模型与一个仅因未能感知信号而看似抵制的模型。
引用
@article{arxiv.2607.01951,
title = {Robust for the Wrong Reasons: The Representational Geometry of LLM Robustness to Science Skepticism},
author = {Minjong Cheon},
journal= {arXiv preprint arXiv:2607.01951},
year = {2026}
}