大型语言模型应用规则中的概念掌握证据
人工智能
2025-04-23 v1 计算与语言
计算机与社会
人机交互
摘要
本文利用心理学方法来探讨大型语言模型在应用规则方面的概念掌握。我们引入一种新方法,将大型语言模型生成思想的多样性匹配到人类样本中观察到的多样性。随后,我们进行了两项实验,比较了人类和大型语言模型中的基于规则的决策。研究 1 发现,所有调查的大型语言模型都复制了人类模式,无论是否使用训练截止日期前或后创建的情景。此外,我们发现两套情景之间的差异在人类之间存在意外差异。令人惊讶的是,这些差异在大型语言模型响应中也被复制了。研究 2 转向人类规则应用的情境特征:在强制时间延迟下,人类样本更依赖规则的文本而非其他考虑因素,如规则的目的。我们的结果显示,一些模型(Gemini Pro 和 Claude 3)对描述强制延迟或时间压力的提示以人类方式作出反应,而其他模型(GPT-4o 和 Llama 3.2 90b)则未作出此类反应。我们认为收集的证据表明,大型语言模型对“规则”这一概念拥有掌握,这对法律决策和哲学探讨都有深远含义。
引用
@article{arxiv.2503.00992,
title = {Evidence of conceptual mastery in the application of rules by Large Language Models},
author = {José Luiz Nunes and Guilherme FCF Almeida and Brian Flanagan},
journal= {arXiv preprint arXiv:2503.00992},
year = {2025}
}