一套语言模型能够像人类一样理解谜题语句
计算与语言
2025-05-15 v1
摘要
近期的研究表明,大型语言模型 (LM) 在理解 minimally 复杂的英文语句方面表现不如人类 (Dentella 等,2024)。本文重新审视了这些发现,认为人类表现被高估了,而语言模型的能力被低估了。使用相同的刺激材料,我们报告了一项预先登记的研究,比较两种条件下的人类响应:一种允许重读(复制原研究),另一种限制重读(更自然的理解测试)。当限制重读时,人类准确率显著下降(73%),低于 Falcon-180B-Chat(76%)和 GPT-4(81%)。更新的 GPT-o1 模型实现了完美准确率。进一步的研究表明,人类和模型都对涉及可能的相互作用查询(例如亲吻)特别敏感,这表明两者都具有类似的语用敏感性,而非模型特有的缺陷。额外的分析使用 Llama-2-70B 的对数概率、对开放式模型响应的重新编码,以及对其他句子的语法正确性评估,揭示了对模型性能的系统性低估。我们发现 GPT-4o 可以根据提示框架与 naive 或专家语法判断相吻合。这一发现凸显了在 LLM 评估中需要更谨慎的实验设计和编码实践的必要性,挑战了当前模型天然弱于人类语言理解能力的假设。
引用
@article{arxiv.2505.08996,
title = {A suite of LMs comprehend puzzle statements as well as humans},
author = {Adele E Goldberg and Supantho Rakshit and Jennifer Hu and Kyle Mahowald},
journal= {arXiv preprint arXiv:2505.08996},
year = {2025}
}