中文

语言模型可接受性判断中包含了什么?重新审视频率与长度的影响

计算与语言 2025-06-04 v3

摘要

在使用语言模型(LM)概率比较语言模型与人类的语言能力时,序列长度和词汇单元的单字频率等因素对LM概率有显著影响,而人类对此大多具有鲁棒性。此前比较LM与人类可接受性判断的工作对这些效应进行统一处理,隐含假设模型需要相同程度的调整来控制长度和单字频率效应。我们提出了MORCELA,一种LM分数与可接受性判断之间的新关联理论,其中长度和单字频率效应的最优调整程度通过学习参数从数据中估计。我们首先证明MORCELA在两个变换器LM家族(Pythia和OPT)上优于常用的可接受性关联理论SLOR(Pauls and Klein, 2012; Lau et al. 2017)。此外,我们证明SLOR中假设的长度和单字频率调整程度对这些混淆因素存在过度校正,且更大模型需要较低程度的单字频率调整,尽管所有模型仍需要显著的调整。最后,我们的后续分析表明,更大LM对频率效应的较低敏感性可由其在上下文中更好地预测罕见词的能力来解释。

关键词

引用

@article{arxiv.2411.02528,
  title  = {What Goes Into a LM Acceptability Judgment? Rethinking the Impact of Frequency and Length},
  author = {Lindia Tjuatja and Graham Neubig and Tal Linzen and Sophie Hao},
  journal= {arXiv preprint arXiv:2411.02528},
  year   = {2025}
}

备注

Accepted to NAACL 2025 (Main Conference)