中文

LLM Bandits 中的刚性及其对人类-AI 组合的影响

人工智能 2026-03-10 v1 计算机科学与博弈论 人机交互

摘要

我们测试了大语言模型是否显示出稳健的决策偏差。将模型视为两臂赌博机的参与者,我们在四种解码配置下进行了每种配置 20000 次试验。 在对称奖励下,模型将位置顺序放大为顽固的单臂政策。在非对称奖励下,他们刚性地进行开发但未达到最优解,且很少重新检查。所观察到的模式在温度和 top-p 的各种操纵下保持一致,其中 top-k 保持提供商的默认值,这表明这种定性行为对 practitioners 通常可用的两种解码旋钮是稳健的。关键的是,超越描述性指标,通过层次 Rescorla-Wagner-softmax 拟合揭示了底层策略:较低的学习率和非常高的逆温度,这两者共同解释了噪声到偏差的放大以及刚性开发。这些结果将最小赌博机定位为大语言模型决策倾向的可行探针,并激发了关于此类偏差如何塑造人类-AI 交互的假设。

关键词

引用

@article{arxiv.2603.07717,
  title  = {Rigidity in LLM Bandits with Implications for Human-AI Dyads},
  author = {Haomiaomiao Wang and Tomás E Ward and Lili Zhang},
  journal= {arXiv preprint arXiv:2603.07717},
  year   = {2026}
}

备注

13 pages, 5 figures, AICS conference https://aicsconf.org/