UnSeenTimeQA:超越 LLM 记忆的时序问答
计算与语言
2025-06-04 v4
摘要
本文介绍 UnSeenTimeQA,这是一个新颖的、无数据污染的时序问答(TSQA)基准测试。它与现有 TSQA 测试基准不同,避免使用基于现实世界可检索查询。我们提出了一系列基于人工生成事实的时序事件情景,要求大语言模型(LLM)在不依赖预训练阶段获取的事实知识的情况下进行真正的时序推理。我们的数据生成框架实现了按需生成新样本,缓解了数据泄露的风险。我们设计了三种时序问题类型,以测试 LLM 在顺序和平行事件发生上的时序推理能力。我们对五种 LLM 在基于人工生成事实的 TSQA 上的评估显示出混合结果:尽管它们在较简单子集上表现良好,但总体性能仍低于基于真实世界事实的 TSQA。错误分析表明,LLM 在处理长程事件依赖关系和平行事件方面存在困难。
引用
@article{arxiv.2407.03525,
title = {UnSeenTimeQA: Time-Sensitive Question-Answering Beyond LLMs' Memorization},
author = {Md Nayem Uddin and Amir Saeidi and Divij Handa and Agastya Seth and Tran Cao Son and Eduardo Blanco and Steven R. Corman and Chitta Baral},
journal= {arXiv preprint arXiv:2407.03525},
year = {2025}
}
备注
Accepted at ACL 2025 (Main)