中文

TRAM:面向大语言模型时间推理的基准评测

计算与语言 2024-06-03 v3

摘要

对时间的推理对于理解自然语言所描述的事件细微差别至关重要。以往关于该主题的研究范围有限,缺乏允许不同研究间一致评估的标准化基准。本文中,我们引入 TRAM,一个由十个数据集组成的时间推理基准,涵盖事件的各类时间方面,如顺序、算术、频率和持续时间,旨在促进对大语言模型(LLMs)时间推理(TeR)能力的全面评估。我们在零样本和少样本场景下评估了 GPT-4 和 Llama2 等流行 LLM,并使用基于 BERT 的和领域特定的模型建立基线。我们的发现表明,性能最佳的模型显著落后于人类表现。我们希望 TRAM 能推动进一步增强 LLM 的 TeR 能力。

关键词

引用

@article{arxiv.2310.00835,
  title  = {TRAM: Benchmarking Temporal Reasoning for Large Language Models},
  author = {Yuqing Wang and Yun Zhao},
  journal= {arXiv preprint arXiv:2310.00835},
  year   = {2024}
}

备注

Findings of ACL 2024