中文

MenatQA:用于测试大语言模型时间理解与推理能力的新数据集

计算与语言 2023-10-10 v1 人工智能

摘要

大语言模型(LLMs)已在诸多自然语言处理(NLP)任务上展现出近乎饱和的性能。因此,人们自然相信LLMs也已掌握时间理解与推理等能力。然而,关于LLMs时间敏感性的研究未受足够重视。为填补此空白,本文构建了多重敏感因素时间问答(MenatQA),涵盖范围因素、顺序因素、反事实因素三个时间因素,共2,853个样本,用于评估LLMs的时间理解与推理能力。本文测试了当前主流的、参数规模从数十亿到数千亿不等的LLMs。结果显示,大多数LLMs在这些因素上以不同程度落后于较小的时序推理模型。具体而言,LLMs对时间偏差表现出显著脆弱性,且严重依赖问题中提供的时间信息。此外,本文通过设计特定提示词与借助外部工具,对潜在改进策略进行了初步探究。这些方法可作为未来研究的宝贵基线或参考。

关键词

引用

@article{arxiv.2310.05157,
  title  = {MenatQA: A New Dataset for Testing the Temporal Comprehension and Reasoning Abilities of Large Language Models},
  author = {Yifan Wei and Yisong Su and Huanhuan Ma and Xiaoyan Yu and Fangyu Lei and Yuanzhe Zhang and Jun Zhao and Kang Liu},
  journal= {arXiv preprint arXiv:2310.05157},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 Findings