中文

ChronoSense:探索大语言模型中时间理解的基准测试

机器学习 2025-07-22 v2 计算与语言

摘要

大语言模型(LLM)在 various NLP 任务中取得了显著的成功,但在推理和算术方面仍面临重大挑战。时间推理作为自然语言理解的关键组成部分,正引起日益关注的研究注意力。然而,对 Allen 区间关系(例如 before, after, during)——这是一种用于表示时间关系的基本框架——的全面测试仍未得到充分探索。为填补这一空白,我们提出了 ChronoSense,一个用于评估大语言模型时间理解的新基准测试。该基准包含 16 个任务,聚焦于识别两个时间事件之间的 Allen 关系以及时间算术,使用抽象事件和来自 Wikidata 的真实世界数据。我们评估了七个最新大语言模型的性能,结果表明模型对 Allen 关系,包括对称关系,处理方式差异很大。此外,发现表明模型可能依赖记忆来回答与时间相关的问题。总体而言,模型的低绩效凸显了需要改进大语言模型中时间理解能力的需求,而 ChronoSense 为该领域的未来研究提供了一个稳健的框架。我们的数据集和源代码均可在 https://github.com/duyguislakoglu/chronosense 获取。

关键词

引用

@article{arxiv.2501.03040,
  title  = {ChronoSense: Exploring Temporal Understanding in Large Language Models with Time Intervals of Events},
  author = {Duygu Sezen Islakoglu and Jan-Christoph Kalo},
  journal= {arXiv preprint arXiv:2501.03040},
  year   = {2025}
}

备注

Accepted to ACL 2025. Results on a larger test set. 13 pages, 2 figures