无控制的表示: 语言模型中的实现效应测试
人工智能
2026-05-26 v1 计算工程、金融与科学
摘要
大型语言模型日益被用作行为模拟器,但其输出是否反映人类类似认知机制而非提示敏感的表面模式,仍不明确。我们通过实现效应 (realization effect) 来研究这一问题,这是行为经济学中一个被充分特征化的现象,即风险偏好在纸上获利与实现获利/损失后会系统性地不同。我们在三个层面评估 LLM 的行为:仅提示的行为灵敏性、内部表示的线性读取,以及通过激活操控的因果控制。仅提示的结果显示出系统的条件灵敏性,但方向性模式未能复制人类的实现效应预测。Gemma 的残差流在第 18 层包含可线性解码的实现状态信号,且对 held-out 提示具有概括能力。沿该方向操控并不改变下游风险选择,尽管这种空结果在正比例尺和负号对称运行中均成立。行为灵敏性、隐含读取和因果控制是三个互不依赖的属性,且成功的隐含读取不足以证明模型在下游决策中依赖于该表示。
引用
@article{arxiv.2605.25151,
title = {Representation Without Control: Testing the Realization Effect in Language Models},
author = {Ciarán Walsh and Emilio Barkett},
journal= {arXiv preprint arXiv:2605.25151},
year = {2026}
}