ComplexTempQA:一个用于复杂时间问答的1亿数据集
计算与语言
2025-08-26 v3
摘要
我们介绍了\textsc{ComplexTempQA},\footnote{数据集和代码见:https://github.com/DataScienceUIBK/ComplexTempQA}这是一个大规模数据集,包含超过1亿个问答对,旨在应对时间问答中的挑战。\textsc{ComplexTempQA}在规模和范围上显著超越了现有基准。利用维基百科和维基数据,该数据集涵盖了跨越二十多年的问题,并提供了无与伦比的规模。我们引入了一种新的分类法,将问题分为\textit{属性}、\textit{比较}和\textit{计数}三类,分别围绕事件、实体和时间段展开。\textsc{ComplexTempQA}的一个突出特点是其问题的高度复杂性,这些问题需要推理能力才能回答,例如跨时间比较、时间聚合,以及涉及时间事件排序和实体识别的多跳推理。此外,每个问题都附有详细的元数据,包括具体的时间范围,从而能够全面评估大型语言模型的时间推理能力。
引用
@article{arxiv.2406.04866,
title = {ComplexTempQA:A 100m Dataset for Complex Temporal Question Answering},
author = {Raphael Gruber and Abdelrahman Abdallah and Michael Färber and Adam Jatowt},
journal= {arXiv preprint arXiv:2406.04866},
year = {2025}
}
备注
Accepted at EMNLP main