语言模型惊异与隐喻新颖性中的频率混淆
计算与语言
2026-05-19 v2
摘要
语言模型(LM)惊异被广泛用作上下文可预测性的代理,并被报告与隐喻新颖性判断相关。然而,惊异与词频紧密交织。我们使用两种不同的词频度量来探索这种相互作用对隐喻新颖性评分的影响。我们分析了来自 8 种 Pythia 模型规模和 154 个训练检查点的惊异估计。在各种设置下,词频是比惊异更强的隐喻新颖性预测因子。在各个训练阶段,惊异-新颖性关联在早期达到峰值然后再次下降,这反映了惊异-频率关联在相似时间点的增加。这些结果表明,常被报告的最优 LM 惊异设置可能错误地将上下文可预测性与隐喻新颖性和处理难度联系起来,而词频可能是主要的潜在因素。
引用
@article{arxiv.2605.06506,
title = {The Frequency Confound in Language-Model Surprisal and Metaphor Novelty},
author = {Omar Momen and Sina Zarrieß},
journal= {arXiv preprint arXiv:2605.06506},
year = {2026}
}
备注
to be presented and published at the 15th Joint Conference on Lexical and Computational Semantics (*SEM 2026)