中文

语言模型能否从间接证据中诱导语法知识?

计算与语言 2024-10-24 v2

摘要

语言模型需要多少数据,以及何种数据才能高效诱导语法知识以判断句子可接受性?近期语言模型在数据效率方面仍需大幅提升,以媒近人类水平.本文探讨语言模型是否能高效利用间接数据(间接证据),从而推断句子可接受性.相较之下,人类能够高效利用间接证据,这被视为促进高效语言习得的一种归纳偏置.为探索此问题,我们引入Wug间接证据测试集(WIDET),该数据集包含训练实例和评估实例.我们将含新造奇异词的合成实例注入预训练数据中,探讨模型在评估数据上的行为,该评估数据 assesses 这些词的语法可接受性.我们通过变化注入实例的间接性程度和数量来设计实验.我们的实验意外发现,在某些语言现象中,语言模型即便反复接触结构相同仅词汇差异的评估实例,仍无法诱导语法知识.我们的发现表明,未来研究的潜在方向是:开发能够利用潜在间接证据诱导语法知识的模型.

关键词

引用

@article{arxiv.2410.06022,
  title  = {Can Language Models Induce Grammatical Knowledge from Indirect Evidence?},
  author = {Miyu Oba and Yohei Oseki and Akiyo Fukatsu and Akari Haga and Hiroki Ouchi and Taro Watanabe and Saku Sugawara},
  journal= {arXiv preprint arXiv:2410.06022},
  year   = {2024}
}

备注

This paper is accepted at EMNLP 2024 Main