GPT-4 在语言语用学上是否超越了人类表现?
计算与语言
2025-08-26 v2 人工智能
计算机与社会
摘要
随着大语言模型(LLMs)作为通用多模态 AI 系统越来越多地融入日常生活,其模拟人类理解的能力正受到审视。本研究调查了 LLMs 解释语言语用学的能力,这涉及语境和隐含意义。使用格莱斯(Grice)沟通原则,我们在基于对话的任务上评估了 LLMs(GPT-2、GPT-3、GPT-3.5、GPT-4 和 Bard)和人类受试者(N = 147)。人类参与者包括 71 名以塞尔维亚语为主的学生和 76 名来自美国的英语母语者。结果显示,LLMs,尤其是 GPT-4,表现优于人类。GPT-4 获得了 4.80 的最高分,超过了 4.55 的人类最高分。其他 LLMs 表现良好:GPT-3.5 得分 4.10,Bard 3.75,GPT-3 3.25。GPT-2 得分最低,为 1.05。LLM 的平均得分为 3.39,超过了人类群体的平均分(塞尔维亚学生 2.80,美国参与者 2.34)。在所有 155 名受试者(包括 LLMs 和人类)的排名中,GPT-4 确保了第一的位置,而表现最好的人类排名第二。这些结果突显了 LLMs 在模拟语言语用学理解能力方面的重大进展。未来的研究应通过更多基于对话的任务和多样化的参与者来证实这些发现。这项研究对于在各种以沟通为中心的任务中推进通用 AI 模型具有重要意义,包括未来在人形机器人中的潜在应用。
引用
@article{arxiv.2312.09545,
title = {Does GPT-4 surpass human performance in linguistic pragmatics?},
author = {Ljubisa Bojic and Predrag Kovacevic and Milan Cabarkapa},
journal= {arXiv preprint arXiv:2312.09545},
year = {2025}
}
备注
19 pages, 1 figure, 2 tables