中文

息息相关的时间推理:大语言模型能否把握时空关系?

计算与语言 2024-06-14 v1

摘要

时间推理是大语言模型 (LLMs) 理解世界的基本能力。当前的时间推理数据集局限于关于单个或孤立事件的问题,未能映射出涉及并发特性及复杂时序相互关联的现实时序特征。在本文中,我们引入 CoTempQA,一套全面的共时 Question Answering (QA) 基准测试,包含四种共时情境 (Equal、Overlap、During、Mix),共计 4,748 个样本,用于评估 LLMs 的共时理解与推理能力。我们的广泛实验揭示了当前 LLMs 在 CoTempQA 任务上与人类水平推理之间存在显著差距。即便采用链式思维 (CoT) 方法增强,模型仍在本任务上持续困境。我们在初步探索中发现,数学推理在处理共时事件方面发挥关键作用,并提出一种从数学视角提升 LLMs 共时推理能力的策略。我们希望我们的 CoTempQA 数据集能鼓励进一步发展,以提升 LLMs 的共时推理能力。我们的代码已公开于 https://github.com/zhaochen0110/Cotempqa。

关键词

引用

@article{arxiv.2406.09072,
  title  = {Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?},
  author = {Zhaochen Su and Juntao Li and Jun Zhang and Tong Zhu and Xiaoye Qu and Pan Zhou and Yan Bowen and Yu Cheng and Min zhang},
  journal= {arXiv preprint arXiv:2406.09072},
  year   = {2024}
}

备注

This paper has been accepted to the ACL 2024 main conference