当前大语言模型仍无法‘多谈论’语法模块:来自语法核心属性的证据
计算与语言
2026-04-10 v4
摘要
我们旨在考察大语言模型(LLM)在‘多谈论’语法模块方面的能力,提供来自语法核心属性被翻译成阿拉伯语的证据。我们收集了44个来自生成语法领域著作(包括书籍和期刊文章)以及来自我们在该领域经验的术语。这些术语分别由人类翻译,然后由ChatGPT-5翻译。我们随后对两套翻译进行分析和比较。我们采用分析性和比较性的方法进行分析。研究发现,LLM仍无法‘多谈论’研究中涉及多个语法和语义挑战的核心语法属性:只有25%的ChatGPT翻译是准确的,而38.6%是不准确的,36.4%是部分正确的,我们认为这足够。基于这些发现,提出了一套可操作的策略,其中最显著的策略是AI专家与语言学家密切合作,以更好地改进LLM的工作机制,以实现准确或至少合适的翻译。
引用
@article{arxiv.2603.20114,
title = {Current LLMs still cannot 'talk much' about grammar modules: Evidence from syntax},
author = {Mohammed Q. Shormani and Yehia A. AlSohbani},
journal= {arXiv preprint arXiv:2603.20114},
year = {2026}
}
备注
15 pages