中文

TReMu:面向多会话对话中具有记忆的LLM-Agent的神经符号时序推理

人工智能 2025-09-26 v2

摘要

多会话对话中的时序推理是一个重大挑战,在以往的时序推理基准测试中研究不足。为弥合这一差距,我们提出了一个针对多会话对话中时序推理的新评估任务,并引入了一种通过增强LoCoMo对话并创建多选问答来构建新基准的方法。此外,我们提出了TReMu,一个旨在增强LLM-Agent在此情境下时序推理能力的新框架。具体而言,该框架通过时间线摘要实现时间感知记忆,通过总结每个对话会话中的事件及其推断日期来生成可检索的记忆。此外,我们集成了神经符号时序推理,让LLM生成Python代码来执行时序计算并选择答案。在流行LLM上的实验评估表明,我们的基准具有挑战性,并且所提出的框架相比基线方法显著提升了时序推理性能,在GPT-4o上从标准提示的29.83提升至我们方法的77.67,突显了其在处理多会话对话中时序推理的有效性。

关键词

引用

@article{arxiv.2502.01630,
  title  = {TReMu: Towards Neuro-Symbolic Temporal Reasoning for LLM-Agents with Memory in Multi-Session Dialogues},
  author = {Yubin Ge and Salvatore Romeo and Jason Cai and Raphael Shu and Monica Sunkara and Yassine Benajiba and Yi Zhang},
  journal= {arXiv preprint arXiv:2502.01630},
  year   = {2025}
}

备注

Accepted at ACL 2025 Findings