MEMTRACK:评估多平台动态智能体环境中的长期记忆与状态跟踪
密码学与安全
2025-10-03 v1 人工智能
计算与语言
摘要
近期关于上下文和记忆基准测试的工作主要集中在对话场景,但在动态企业环境中评估记忆的需求对于其有效应用至关重要。我们引入了MEMTRACK,这是一个旨在评估多平台智能体环境中长期记忆和状态跟踪的基准。MEMTRACK通过集成跨越多个通信和生产力平台(如Slack、Linear和Git)的异步事件,对现实中的组织工作流进行建模。每个基准实例提供了一个按时间顺序平台交错的时间线,包含噪声、冲突、交叉引用的信息,以及潜在的代码库/文件系统理解和探索。因此,我们的基准测试了诸如获取、选择和冲突解决等记忆能力。我们通过手动专家驱动设计和可扩展的基于智能体的合成来精心整理MEMTRACK数据集,生成植根于真实世界软件开发过程的生态有效场景。我们引入了正确性、效率和冗余度等相关指标,以捕捉超越简单问答性能的记忆机制有效性。在SoTA LLM和记忆后端上的实验揭示了在长周期内利用记忆、处理跨平台依赖和解决矛盾方面的挑战。值得注意的是,表现最佳的GPT-5模型在MEMTRACK上仅获得了60%的正确性得分。这项工作提供了一个可扩展的框架,用于推进记忆增强智能体的评估研究,超越了现有对对话场景的关注,并为复杂组织环境中的多智能体、多平台记忆基准测试奠定了基础。
引用
@article{arxiv.2510.01354,
title = {WAInjectBench: Benchmarking Prompt Injection Detections for Web Agents},
author = {Yinuo Liu and Ruohan Xu and Xilong Wang and Yuqi Jia and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2510.01354},
year = {2025}
}