中文

婴儿语言模型是否对格里斯最大原则不敏感?基于样本高效语言模型的语用学评估

计算与语言 2025-10-09 v2

摘要

隐含意义是人类交流的重要组成部分,因此对于语言模型而言,必须具备识别和解释这些意义的能力。格里斯 (1975) 提出了一组对话最大原则,这些原则指导合作对话,指出说话者可能故意违反这些原则以表达字面意义之外的意义,而听者随后则识别此类违反以推断语用意义。建立在 Surian 等 (1996) 研究儿童对格里斯最大原则违反敏感性基础上,我们引入了一个新基准,用于测试预训练于不足 100 万 token 或不足 100 万 token 的语言模型是否能区分遵循最大原则与违反最大原则的言语。我们将这些 BabyLMs 在五个最大原则下的表现进行比较,并将其性能置于儿童与基于 300 万 token 预训练的大语言模型 (LLM) 之中。我们发现,总体而言,训练不足 100 万 token 的模型优于训练不足 10 万 token 的模型,但未达到儿童水平或 LLM 水平。我们的结果表明,适度的数据增加改善了某些语用行为方面的表现,从而实现了对语用维度的更细致区分。

关键词

引用

@article{arxiv.2510.04764,
  title  = {Are BabyLMs Deaf to Gricean Maxims? A Pragmatic Evaluation of Sample-efficient Language Models},
  author = {Raha Askari and Sina Zarrieß and Özge Alacam and Judith Sieker},
  journal= {arXiv preprint arXiv:2510.04764},
  year   = {2025}
}

备注

Accepted for the BabyLM workshop in EMNLP 2025