中文

STBench:评估大型语言模型在时空分析能力的基准

计算与语言 2024-06-28 v1

摘要

大型语言模型(LLMs)的快速发展为时空数据挖掘方法论的变革提供了前景。然而,现有评估LLMs时空理解能力的工作存在局限和偏差:这些工作要么未纳入最新的语言模型,要么仅关注评估记忆化时空知识。为此本文将LLMs时空数据处理能力解构为四个维度:知识理解、时空推理、精确计算和下游应用。我们为每个类别精选了若干自然语言问答任务,并构建了名为STBench的数据集,包含13个不同任务及6万余道QA对。此外,我们评估了包括GPT-4o、Gemma和Mistral在内的13种LLMs的能力。实验结果表明,现有LLMs在知识理解和时空推理任务上表现突出,但在其他任务方面通过通过在上下文学习、链式思考提示和微调等方式仍有提升空间。STBench的代码和数据集已发布于 https://github.com/LwbXc/STBench。

关键词

引用

@article{arxiv.2406.19065,
  title  = {STBench: Assessing the Ability of Large Language Models in Spatio-Temporal Analysis},
  author = {Wenbin Li and Di Yao and Ruibo Zhao and Wenjie Chen and Zijie Xu and Chengxue Luo and Chang Gong and Quanliang Jing and Haining Tan and Jingping Bi},
  journal= {arXiv preprint arXiv:2406.19065},
  year   = {2024}
}