TRAM:面向大语言模型时间推理的基准评测
计算与语言
2024-06-03 v3
摘要
对时间的推理对于理解自然语言所描述的事件细微差别至关重要。以往关于该主题的研究范围有限,缺乏允许不同研究间一致评估的标准化基准。本文中,我们引入 TRAM,一个由十个数据集组成的时间推理基准,涵盖事件的各类时间方面,如顺序、算术、频率和持续时间,旨在促进对大语言模型(LLMs)时间推理(TeR)能力的全面评估。我们在零样本和少样本场景下评估了 GPT-4 和 Llama2 等流行 LLM,并使用基于 BERT 的和领域特定的模型建立基线。我们的发现表明,性能最佳的模型显著落后于人类表现。我们希望 TRAM 能推动进一步增强 LLM 的 TeR 能力。
引用
@article{arxiv.2310.00835,
title = {TRAM: Benchmarking Temporal Reasoning for Large Language Models},
author = {Yuqing Wang and Yun Zhao},
journal= {arXiv preprint arXiv:2310.00835},
year = {2024}
}
备注
Findings of ACL 2024