SocialMemBench: AI 记忆系统是否就绪用于社交群体场景?
计算与语言
2026-05-19 v1 人工智能
摘要
为单用户对话构建的 AI 助手记忆系统在应用于多方社交群体场景时往往表现不佳。这一差距对于当今正在构建的社交助手至关重要:嵌入聊天平台的群体行为智能体,以及必须包含社交背景的整体性用户模型的主动个人助手。现有记忆基准评估的是二方或职场对话;没有针对多方社交群体的基准,在此场景下,记忆必须将事实锚定在共享历史中,而非职业角色中,区分群体规范与个体例外情况,并在成员离开后正确归因。我们引入SocialMemBench,这是一个包含五种原型类型(亲密朋友、家庭、休闲、兴趣社区、熟人网络)和三种群体规模层级(4-30 成员)的人类验证合成社交群体网络基准,包含 430 个角色和 7,355 轮对话,产生 1,031 组问答对,覆盖九个问题类别。每个类别均隔离了一个架构能力,五种失败模式(单流混合、时序状态覆盖、规模化实体合并、缺失跨角色知识、规范-个体混合)均可被测试为假设;我们的两项研究探针Subject-Mem和SMG提供了对两种问题的证据,另外三项 remains open。一个完整上下文的 Gemini 2.5 Flash 参考模型在小型网络上仅达到 0.721,而对盲评推理模型的平均得分为 0.98,表明该基准即使在获得完整对话访问权限下也具有很高的难度。在所有 43 个网络中,评估的四个开源记忆框架( Mem0、LangMem、Graphiti、Cognee)在 0.12-0.18 的问卷加权范围内聚集,95% 置信区间重叠,显著低于未压缩检索参考模型的 0.345 和匹配答案者完整上下文参考模型的 0.369(GPT-4o-mini)。当前记忆系统显示出可测量的差距。
引用
@article{arxiv.2605.17789,
title = {SocialMemBench: Are AI Memory Systems Ready for Social Group Settings?},
author = {Olukunle Owolabi},
journal= {arXiv preprint arXiv:2605.17789},
year = {2026}
}