HistoryBankQA:面向历史事件的多语言时间问答
计算与语言
2025-09-17 v1
摘要
关于历史事件的时间推理是事件抽取、历史实体链接、时间问答、时间线摘要、时间事件聚类和时间自然语言推理等自然语言处理任务的一项关键技能。然而,对大型语言模型(LLM)时间推理能力进行基准测试的努力相当有限。现有的时间推理数据集规模有限,缺乏多语言覆盖,且更侧重于当代事件。为了解决这些局限性,我们提出了HistoryBank,这是一个从维基百科时间线页面和文章信息框中提取的、包含超过1000万条历史事件的多语言数据库。我们的数据库在历史深度和语言广度上提供了前所未有的覆盖,涵盖10种语言。此外,我们构建了一个全面的问答基准,用于跨所有语言的时间推理。该基准涵盖了6种不同的时间问答推理任务,我们评估了一系列流行的语言模型(LLaMA-3-8B、Mistral-7B、Gemma-2-9b、Qwen3-8B、GPT4o),以评估它们在这些任务上的表现。正如预期,GPT4o在所有答案类型和语言中表现最佳;Gemma-2优于其他小型语言模型。我们的工作旨在为推进对历史事件的多语言和时间感知的自然语言理解提供全面的资源。为促进进一步研究,我们将在论文被接收后公开我们的代码和数据集。
引用
@article{arxiv.2509.12720,
title = {HistoryBankQA: Multilingual Temporal Question Answering on Historical Events},
author = {Biswadip Mandal and Anant Khandelwal and Manish Gupta},
journal= {arXiv preprint arXiv:2509.12720},
year = {2025}
}