中文

大语言模型与人类在多臂老带实验中的探索-利用策略比较:洞察

机器学习 2026-05-04 v3 人工智能 计算与语言 人机交互

摘要

大语言模型 (LLMs) 正在增多地用于在复杂的序列决策情境中模拟或自动化人类行为。一个自然问题随之而来,即 LLMs 是否 exhibit 类似于人类的决策行为,是否能够实现可比或更好的绩效。在本工作中,我们聚焦于探索-利用 (E&E) 折中,这是动态不确定环境中决策的基本方面。我们运用认知科学和精神医学文献中引入的标准多臂老带实验,进行 LLMs、人类和 MAB 算法 E&E 策略的比较研究。我们使用可解释选择模型捕获各代理人的 E&E 策略,并调查通过提示策略和思考模型启用思考过程如何塑造 LLM 决策。我们发现,在 LLMs 中启用思考会将其行为转向更类似人类的行为,表现为随机与有向探索的混合。在简单稳态情境下,启用思考的 LLMs 在随机与有向探索方面表现出与人类相似的水平。然而,在更复杂的非稳态环境中,LLMs 在匹配人类的适应性方面存在挑战,尤其是在有效的有向探索方面,尽管在某些情境下实现了类似的后悔。我们的发现凸显了 LLMs 作为人类行为模拟器和自动化决策工具的潜力与局限,并指向潜在的改进方向。

关键词

引用

@article{arxiv.2505.09901,
  title  = {Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments},
  author = {Ziyuan Zhang and Darcy Wang and Ningyuan Chen and Rodrigo Mansur and Vahid Sarhangian},
  journal= {arXiv preprint arXiv:2505.09901},
  year   = {2026}
}