从逐字到要旨:基于语义信息瓶颈提炼金字塔式多模态记忆用于长期视频智能体
摘要
虽然多模态大语言模型在短期推理方面展现出惊人能力,但在长期视频理解中受限于上下文窗口和静态记忆机制,难以模拟人类认知效率。现有范式通常落入两种极端:视觉中心方法通过密集视觉积累导致高延迟和冗余,或文本中心方法通过激进摘要导致细节丢失和幻觉。为填补这一差距,我们提出 MM-Mem,一种基于模糊追踪理论的金字塔式多模态记忆架构。MM-Mem 将记忆层次化为感官缓冲区、情景流和符号模式,实现从细粒度感知痕迹 (verbatim) 到高层语义模式 (gist) 的渐进式提炼。进一步,为支配记忆动态构建,我们推导语义信息瓶颈目标并引入 SIB-GRPO 以优化记忆压缩与任务相关信息保留之间的权衡。在推理阶段,我们设计了基于熵的自上而下记忆检索策略。广泛实验表明,MM-Mem 在 4 个基准上的离线和流式任务均实现了最佳性能,展现出稳健的泛化能力,验证了受认知启发记忆组织的有效性。代码及相关配置已公开于 https://github.com/EliSpectre/MM-Mem。
引用
@article{arxiv.2603.01455,
title = {From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents},
author = {Niu Lian and Yuting Wang and Hanshu Yao and Jinpeng Wang and Bin Chen and Yaowei Wang and Min Zhang and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2603.01455},
year = {2026}
}
备注
Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary