中文

英文语法可接受性数据集(预览):面向机器学习与语言学分析的资源

计算与语言 2025-06-24 v1

摘要

我们呈现了语法可接受性数据集的预览版,这一资源正在设计用于语法和计算语言学研究。当前版本的数据集包含 1000 个英文序列,其中一半来自教科书,另一半来自期刊《语言学评论》(Linguistic Inquiry),后者旨在确保当代话语的代表性。每个条目都带有其语法状态("根据语法形式化主义的"良好可接受性)从文献中提取,以及其可接受性状态("原生说话者确定的"直觉良好性)通过众包获得,遵循最高的实验标准。即便在初步阶段,该数据集也作为可公开获取的最大其类型的资源。我们还提供初步分析,探讨语言学和计算语言学中的三个争论:我们观察到语法性和可接受性判断在约 83%的情况下收敛,并且"中间状态"相当常见。这证实了现有研究。我们还发现尽管机器学习模型在预测语法性方面困难,但在预测可接受性方面表现出色。这一发现是新的。未来的工作将侧重于扩大数据集。

关键词

引用

@article{arxiv.2506.18120,
  title  = {The Syntactic Acceptability Dataset (Preview): A Resource for Machine Learning and Linguistic Analysis of English},
  author = {Tom S Juzek},
  journal= {arXiv preprint arXiv:2506.18120},
  year   = {2025}
}

备注

Accepted and published at LREC-COLING 2024. 8 pages, 3 figures. Licensed under CC BY-NC-SA 4.0