中文

BRAINTEASER:面向大语言模型的横向思维谜题

计算与语言 2023-11-13 v3

摘要

语言模型的成功启发了 NLP 社区关注需要隐式且复杂推理、依赖类人常识机制的任务。尽管此类纵向思维任务已相对流行,横向思维谜题却鲜受关注。为弥补这一差距,我们设计了 BRAINTEASER:一个多项选择问答任务,旨在测试模型展现横向思维并违背默认常识关联的能力。我们设计了一个三步流程来创建首个横向思维基准,包括数据收集、干扰项生成和对抗样本生成,最终得到 1,100 道带高质量标注的谜题。为评估模型横向推理的一致性,我们基于对其问题的语义与上下文重构来丰富 BRAINTEASER。我们使用最先进的指令微调与常识语言模型进行的实验揭示了人类与模型性能之间的显著差距,当考虑跨对抗格式的一致性时该差距进一步扩大。我们公开所有代码与数据,以激发横向思维模型的开发与评估工作。

关键词

引用

@article{arxiv.2310.05057,
  title  = {BRAINTEASER: Lateral Thinking Puzzles for Large Language Models},
  author = {Yifan Jiang and Filip Ilievski and Kaixin Ma and Zhivar Sourati},
  journal= {arXiv preprint arXiv:2310.05057},
  year   = {2023}
}