评估连续 lifelog 场景中的记忆能力
计算与语言
2026-04-20 v2
摘要
如今,穿戴设备可以持续记录生活方式对话,为记忆系统创造了巨大的机会。然而,现有基准主要关注在线一对一聊天或人机交互,因而忽略了现实场景的独特需求。鉴于公开的 lifelog 音频数据集稀缺,我们提出了分层合成框架以构建 \textbf{\textsc{LifeDialBench}}——一个新颖的基准,包含两个互补的子集:\textbf{EgoMem},基于真实的自我中心视频构建;\textbf{LifeMem},使用模拟虚拟社区构建。关键的是,为了解决传统离线设置中时间泄漏的问题,我们提出了\textbf{在线评估}协议,严格遵循时间因果性,确保系统以真实的流式方式进行评估。我们的实验结果揭示了一个反直觉的发现:当前复杂的记忆系统未能超过一个简单的 RAG 基线。这一发现凸显了当前方法中过度设计结构和有损压缩的负面影响,强调在 lifelog 场景中保持高保真上下文的必要性。
引用
@article{arxiv.2604.11182,
title = {Evaluating Memory Capability in Continuous Lifelog Scenario},
author = {Jianjie Zheng and Zhichen Liu and Zhanyu Shen and Jingxiang Qu and Guanhua Chen and Yile Wang and Yang Xu and Yang Liu and Sijie Cheng},
journal= {arXiv preprint arXiv:2604.11182},
year = {2026}
}
备注
27 pages, 7 figures. ACL 2026 Findings camera-ready