中文

对数概率是基础与指令微调语言模型中语义合理性的可靠估计

计算与语言 2024-10-22 v2 人工智能

摘要

语义合理性(例如,知道“演员获奖”比“演员赢得战斗”更可能发生)可作为一般世界知识的有效代理。语言模型 (LMs) 通过学习文本中的分布模式来捕获大量世界知识,这可以通过它们为合理与不合理输出分配的对数概率 (LogProbs) 来获取。新一代指令微调 LM 现在也可以通过提示提供明确的合理性估计。在此,我们评估了 LogProbs 和基本提示在测量语义合理性方面的有效性,涵盖单句最小对立体(实验 1)和短上下文相关场景(实验 2)。我们发现: 在基础和指令微调 LM 中,LogProbs 都比直接的零样本提示提供了更可靠的语义合理性度量,后者产生不一致且通常较差的结果; 指令微调通常不会改变 LogProbs 对语义合理性的敏感度(尽管有时会降低它); 跨不同模型,上下文大多以预期的方式调节 LogProbs,这一点通过三种新的上下文敏感合理性指标及其与人类显式合理性判断的匹配度得到了测量。我们得出结论,即使在基于提示的评估时代,LogProbs 在基础和指令微调 LM 中仍构成有用的语义合理性指标。

关键词

引用

@article{arxiv.2403.14859,
  title  = {Log Probabilities Are a Reliable Estimate of Semantic Plausibility in Base and Instruction-Tuned Language Models},
  author = {Carina Kauf and Emmanuele Chersoni and Alessandro Lenci and Evelina Fedorenko and Anna A. Ivanova},
  journal= {arXiv preprint arXiv:2403.14859},
  year   = {2024}
}