中文

语言模型是否理解其承诺的认知任务?基于N-Back范式的调查

计算与语言 2025-06-03 v3 人工智能

摘要

最初为人类开发的认知任务如今越来越多地用于研究语言模型。尽管将这些任务应用于模型通常很直接,但对结果的解释可能具有挑战性。特别是当模型表现不佳时,往往难以确定是认知能力的局限性,还是任务理解或任务集合维护的失败。最近的一项研究认为GPT 3.5在2-back和3-back任务上的性能下降反映了类似人类的工作记忆容量限制(Gong等人,2024)。通过分析不同性能水平的开源语言模型在这些任务上的表现,我们显示表现不佳至少部分源于任务理解和任务集合维护的局限性。我们将最佳表现模型置于逐渐更具挑战性的任务版本(最高达10-back)之下,并实验不同的提示策略,随后分析模型注意力。我们更大范围的目标是为语言模型认知评估的方法论发展贡献力量。

关键词

引用

@article{arxiv.2412.18120,
  title  = {Do Language Models Understand the Cognitive Tasks Given to Them? Investigations with the N-Back Paradigm},
  author = {Xiaoyang Hu and Richard L. Lewis},
  journal= {arXiv preprint arXiv:2412.18120},
  year   = {2025}
}

备注

ACL 2025 Findings