中文

噪声、适应与策略:评估LLM在决策中的忠诚度

计算工程、金融与科学 2025-08-25 v1 人工智能

摘要

大型语言模型(LLMs)越来越多地被用于社会科学仿真。虽然它们在推理和优化任务上的表现已被广泛评估,但对其模拟人类决策 Variability 和适应性的能力关注较少。我们提出了一个以进程为导向的评估框架,通过渐进性干预(固有性、指令和模仿)来检验LLM代理在不同水平的外部指导和人类衰减噪声下的适应性。我们在两个经典经济学任务上验证了该框架:第二拍卖中的非理性和新闻商问题中的决策偏差,显示出LLMs与人类的行为差异。我们发现,LLMs默认情况下会收敛到稳定且保守的策略,这与观察到的人类行为相矛盾。风险框架的指令对LLM行为有可预测的影响,但无法复制人类行为的多样性。通过在上下文学习中纳入人类数据可缩小差距,但未能达到人类主体的战略变异性。这些结果凸显了行为忠诚度中的持久的对齐差距,表明未来的LLM评估应考虑更进程层面的真实性。我们提出了一种用于评估LLMs在动态决策任务中的进程导向方法,为其在社会科学研究中用于合成数据提供了指导。

关键词

引用

@article{arxiv.2508.15926,
  title  = {Noise, Adaptation, and Strategy: Assessing LLM Fidelity in Decision-Making},
  author = {Yuanjun Feng and Vivek Choudhary and Yash Raj Shrestha},
  journal= {arXiv preprint arXiv:2508.15926},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Main Conference)