叙事式思维:通过复述叙事提升大语言模型的时间推理
计算与语言
2024-11-19 v2 人工智能
摘要
关于时间和时间关系的推理是人类认知的内在方面,对于感知世界和导航我们的经验至关重要。尽管大语言模型 (LLM) 在许多推理任务中已显示出惊人的性能,但由于其内在复杂性,时间推理仍然具有挑战性。在本工作中,我们首先研究了一个基本的时间推理任务——时间图生成,以揭示 LLM 的内在全局推理能力。我们显示,该任务即使对最强大的 LLM 如 GPT-3.5/4 也是具有挑战性的。我们也注意到小型模型 (<10B) 在 LLM 性能上存在约 50% 的差距。接下来,我们研究如何在预算约束下(例如不使用模型微调)来缩小这一差距。我们提出一种针对时间推理的新型提示技术,叙事式思维 (NoT),该技术首先将事件集合转换为 Python 类,然后提示小型模型生成一个时间导向的叙事,从而指导最终的时间图的生成。大量实验展示了 NoT 在改进各种指标方面的有效性。值得注意的是,NoT 在 Schema-11 评估集上实现了最高的 F1 分数,同时在整体 F1 分数上与 GPT-3.5 持平。NoT 还在所有指标上实现了最佳的结构相似性,甚至与 GPT-3.5/4 相比也如此。我们的代码可在 https://github.com/launchnlp/NoT 获取。
引用
@article{arxiv.2410.05558,
title = {Narrative-of-Thought: Improving Temporal Reasoning of Large Language Models via Recounted Narratives},
author = {Xinliang Frederick Zhang and Nick Beauchamp and Lu Wang},
journal= {arXiv preprint arXiv:2410.05558},
year = {2024}
}
备注
EMNLP'24 Findings