PAT-Questions:面向基于当前锚定的时间问答的自更新基准
计算与语言
2024-06-05 v2
摘要
现有关于时间问答(Temporal Question Answering, TQA)的工作主要集中在锚定于特定时间戳或事件的问题上(例如“1970年的美国总统是谁?”)。很少有工作研究其时间上下文相对于当前时间的问题(例如“上一任美国总统是谁?”)。我们将此问题称为基于当前锚定的时间问答(Present-Anchored Temporal QA, PATQA)。PATQA 带来了独特的挑战:(1)大型语言模型(LLM)可能具有过时的知识,(2)复杂的时间关系(例如“之前”、“上一任”)难以推理,(3)可能需要多跳推理,(4)基准的标准答案必须持续更新。为了应对这些挑战,我们引入了 PAT-Questions 基准,其中包含单跳和多跳时间问题。如果知识图谱可用,PAT-Questions 中的答案可以通过在知识图谱上重新运行 SPARQL 查询来自动刷新。我们通过直接提示和检索增强生成(RAG)在 PAT-Questions 上评估了几个最先进的 LLM 和一个 SOTA 时间推理模型(TEMPREASON-T5)。结果突出了现有解决方案在 PATQA 上的局限性,并表明需要新方法来提升 PATQA 的推理能力。
引用
@article{arxiv.2402.11034,
title = {PAT-Questions: A Self-Updating Benchmark for Present-Anchored Temporal Question-Answering},
author = {Jannat Ara Meem and Muhammad Shihab Rashid and Yue Dong and Vagelis Hristidis},
journal= {arXiv preprint arXiv:2402.11034},
year = {2024}
}
备注
Accepted to Findings of ACL '24