ChatGPT 中的语法表示方式与语言学家及普通人群的对比研究
计算与语言
2024-06-18 v1
摘要
大语言模型(LLM)在各类语言任务上展现出卓越的性能,但是否具备类人细粒度语法直觉仍不明确。本项预先注册研究(https://osf.io/t5nes)是首次大规模调查 ChatGPT 语法直觉的研究,基于先前对 148 种语言现象(即语法、不语法或边缘语法)的人类语言学家判断进行的人类普通人语法判断收集。我们的主要焦点是比较 ChatGPT 与普通人和语言学家在这些语言构造上的判断。在实验 1 中,ChatGPT 根据给定的参考句子为句子赋值。在实验 2 中,对句子在 7 分制上的评级。在实验 3 中,要求 ChatGPT 从一对句子中选择更符合语法的那个。总体而言,我们的发现显示 ChatGPT 与语言学家之间的收敛率范围为 73% 至 95%,总体估计为 89%。在所有任务中,ChatGPT 与普通人之间也发现了显著的相关性,但相关强度因任务而异。我们将这些结果归因于判断任务的心理测量性质以及人类与 LLM 之间语言处理方式的差异。
引用
@article{arxiv.2406.11116,
title = {Grammaticality Representation in ChatGPT as Compared to Linguists and Laypeople},
author = {Zhuang Qiu and Xufeng Duan and Zhenguang G. Cai},
journal= {arXiv preprint arXiv:2406.11116},
year = {2024}
}
备注
23 pages