中文

大语言模型(LLM)的简单语言推理:盲点与遮蔽

计算与语言 2024-04-12 v2 人工智能

摘要

我们在大多数人类认为微不足道的简单推理任务上评估了 LLM 的语言理解能力。具体而言,我们针对(i)语法规定的蕴涵、(ii)含不确定性证据副词的前提,以及(iii)单调性蕴涵。我们为这些任务设计了评估集,并在零样本和思维链设置下,使用多个提示和 LLM 进行了实验。模型在这些评估集上表现出中等至较低的性能。后续实验表明,将前提嵌入本应保留蕴涵关系(预设触发语)或改变蕴涵关系(非事实动词)的句法结构中,会进一步混淆模型,导致它们无论真实关系如何,都对某些蕴涵标签欠预测或过度预测,且常常忽视嵌入语境的性质。总体而言,这些结果表明,尽管 LLM 的语言理解能力备受赞誉,即便是最强的模型在某些类型的蕴涵上仍存在盲点,且某些信息包装结构充当了“遮蔽物”,掩盖了嵌入前提的语义。

关键词

引用

@article{arxiv.2305.14785,
  title  = {Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds},
  author = {Victoria Basmov and Yoav Goldberg and Reut Tsarfaty},
  journal= {arXiv preprint arXiv:2305.14785},
  year   = {2024}
}