中文

S3Mem:结构化时空场景-事件记忆用于长程交互式问答

计算与语言 2026-05-29 v1 人工智能

摘要

长程交互式智能体常积累大量轨迹历史,但仍难可靠地回答关于早期事件的问题。我们认为,瓶颈不在于上下文长度本身,而在于长期记忆的轨迹至答案接口。当历史以纯文本块形式存储,并使用标准检索增强生成(RAG)查询时,系统常检索到局部相关但链条不完整的证据,尤其是针对空间、时间、重复事件和多跳状态问题。我们提出S3MEM,一种结构化场景-事件记忆框架,用于长程交互式问答(QA)。S3MEM将轨迹写入结构化记忆单元,通过锚点敏感检索获取证据,并在答案推理时暴露紧凑的token预算感知证据接口。从而,S3MEM是一个结构化证据工具库,将智能体轨迹转换为查询对齐的支持。我们在两个内部新闻环境(Crafter、Jericho)和两个外部家庭环境(SciWorld、ALFWorld)上评估S3MEM。在统一的冻结答案时间协议下,S3MEM在所有四个环境中均显著优于Vanilla RAG,超越Graph-NoReader于Crafter、Jericho和ALFWorld,仅在SciWorld上持平,且使用显著更少的证据token。三个经过适配的最新基线——基于A-MEM的、MemoryOS适配的和LightMem适配的——在多个设置中均优于Vanilla RAG,但均未达到S3MEM的整体准确率-效率前沿。总体而言,证据表明:在当前冻结答案时间协议下,结构化写入和锚点敏感证据路由在长程交互式问答中优于更通用的记忆接口。

关键词

引用

@article{arxiv.2605.28831,
  title  = {S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering},
  author = {Encheng Su and Jinouwen Zhang and Jianyu Wu and Qiucheng Yu and Chen Tang and Pengze Li and Lintao Wang and Yizhou Wang and Xinzhu Ma and Shixiang Tang and Aoran Wang},
  journal= {arXiv preprint arXiv:2605.28831},
  year   = {2026}
}