中文

WorldSense:面向大语言模型具身推理的合成基准

计算与语言 2023-11-28 v1 人工智能

摘要

我们提出 WorldSense,一个用于评估 LLM 在多大程度上能够一致地维持默示世界模型(tacit world models)的基准,其测试方式为:考察模型如何从对实体简单排列的描述中得出简单推断。WorldSense 是一个合成基准,包含三类问题,每类均有其自身的平凡对照(trivial control),它通过使问题的抽象结构与词汇及表达去相关、并使所有问题子部分与正确响应去相关,来显式避免偏差。我们在三个最先进的聊天型 LLM(GPT3.5、GPT4 和 Llama2-chat)上运行该基准,结果表明这些模型即便在仅有三个对象时也会出错。此外,它们具有相当严重的响应偏差,无论问题如何都偏好某些响应。即便使用思维链提示(chain-of-thought prompting)和上下文学习(in-context learning),错误依然存在。最后,我们表明,尽管在类似问题上进行微调确实带来了实质性提升——包括分布内与分布外——但微调后的模型无法泛化到约束问题空间之外。

关键词

引用

@article{arxiv.2311.15930,
  title  = {WorldSense: A Synthetic Benchmark for Grounded Reasoning in Large Language Models},
  author = {Youssef Benchekroun and Megi Dervishi and Mark Ibrahim and Jean-Baptiste Gaya and Xavier Martinet and Grégoire Mialon and Thomas Scialom and Emmanuel Dupoux and Dieuwke Hupkes and Pascal Vincent},
  journal= {arXiv preprint arXiv:2311.15930},
  year   = {2023}
}