还记得那一年的事件吗?评估大型语言模型中的时间信息与推理能力
计算与语言
2024-07-08 v2 人工智能
机器学习
摘要
大型语言模型日益无处不在,然而其保留和推理时间信息的能力仍然有限,这阻碍了它们在理解事件先后顺序至关重要的实际场景中的应用。我们的研究在一个全新的数值-时间数据集 \textbf{TempUN} 上对 12 个最先进的模型(参数量从 2B 到 70B+ 不等)进行了实验,该数据集时间跨度从公元前 10,000 年到公元 2100 年,旨在揭示模型在时间信息保留与理解方面的重大局限性。我们提出了六项指标来评估三种学习范式,以增强时间知识的获取。我们的研究结果表明,开源模型更频繁地表现出知识盲区,这表明在有限知识与错误回答之间存在权衡。此外,各种微调方法显著提升了性能,减少了错误输出,并影响了生成中对“信息不可用”的识别。相关数据集和代码可在 获取。
引用
@article{arxiv.2402.11997,
title = {Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models},
author = {Himanshu Beniwal and Dishant Patel and Kowsik Nandagopan D and Hritik Ladia and Ankit Yadav and Mayank Singh},
journal= {arXiv preprint arXiv:2402.11997},
year = {2024}
}