中文

通过多跳问答数据集与伪指令微调实现大语言模型鲁棒时间推理

计算与语言 2024-07-15 v2

摘要

现实世界中的知识在不断更新。然而,频繁更新大语言模型(LLMs)代价高昂。因此,LLMs 理解时间知识概念至关重要。然而,先前关于时间问答(TQA)的工作未强调多答案和多跳类型的时间推理。本文中,我们提出一个聚焦于多答案和多跳时间推理的复杂时间问答数据集 Complex-TR。此外,我们还提出一种新颖的数据增强策略,以提升 LLMs 的复杂时间推理能力与鲁棒性。我们在多个时间 QA 数据集上进行了实验。实验结果表明,我们的方法能够显著提升 LLMs 在时间 QA 基准上的性能。我们的代码与数据发布于:https://github.com/nusnlp/complex-tr。

关键词

引用

@article{arxiv.2311.09821,
  title  = {Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning},
  author = {Qingyu Tan and Hwee Tou Ng and Lidong Bing},
  journal= {arXiv preprint arXiv:2311.09821},
  year   = {2024}
}

备注

To appear in Findings of ACL 2024