MemoryCD: 评估LLM代理长期跨域个性化中长上下文用户记忆的基准测试
计算与语言
2026-03-30 v1
摘要
近期大型语言模型(LLM)的进展将上下文窗口扩展至百万级token规模,但用于评估记忆的基准测试仍局限于短会话的合成对话。我们提出\textsc{MemoryCD},这是首个基于Amazon Review数据集中真实终身行为构建的大规模、以用户为中心的跨域记忆基准。与依赖脚本化角色生成合成用户数据的现有记忆数据集不同,\textsc{MemoryCD}追踪用户在多年间跨越多个领域的真实交互。我们构建了一个多维度长上下文记忆评估流水线,涵盖14种最先进的LLM基础模型和6种记忆方法基线,在4种不同的个性化任务上评估12个多样化领域,以衡量代理在单域和跨域设置中模拟真实用户行为的能力。我们的分析表明,现有记忆方法在各领域中的表现远未达到用户满意度,为跨域终身个性化评估提供了首个测试平台。
引用
@article{arxiv.2603.25973,
title = {MemoryCD: Benchmarking Long-Context User Memory of LLM Agents for Lifelong Cross-Domain Personalization},
author = {Weizhi Zhang and Xiaokai Wei and Wei-Chieh Huang and Zheng Hui and Chen Wang and Michelle Gong and Philip S. Yu},
journal= {arXiv preprint arXiv:2603.25973},
year = {2026}
}
备注
Published as a workshop paper in Lifelong Agent @ ICLR 2026