中文

面向多模态终身理解:一个数据集与智能体基线

计算机视觉与模式识别 2026-03-06 v1

摘要

虽然视频理解数据集规模已扩展到数小时时长,但通常由密集拼接的片段构成,这些片段与自然、未经编排的日常生活场景有较大差异。为弥合这一差距,我们引入了 MM-Lifelong 数据集,专为多模态终身理解设计。该数据集包含 181.1 小时的录像 footage,横跨日、周、月三个时间尺度,以捕捉不同时间密度。广泛的评估结果揭示了当前范式中的两个关键失效模式:端到端的多模态大语言模型因上下文饱和导致工作记忆瓶颈,而代表性智能体基线在稀疏的月长时间线导航时会出现全局局部化崩溃。为此,我们提出了递归多模态智能体 (ReMA),其采用动态记忆管理,迭代更新递归信念状态,显著优于现有方法。最后,我们建立了数据划分,旨在隔离时间和领域偏差,为未来在监督学习和分布外推理方面的研究提供严谨的基础。

关键词

引用

@article{arxiv.2603.05484,
  title  = {Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline},
  author = {Guo Chen and Lidong Lu and Yicheng Liu and Liangrui Dong and Lidong Zou and Jixin Lv and Zhenquan Li and Xinyi Mao and Baoqi Pei and Shihao Wang and Zhiqi Li and Karan Sapra and Fuxiao Liu and Yin-Dong Zheng and Yifei Huang and Limin Wang and Zhiding Yu and Andrew Tao and Guilin Liu and Tong Lu},
  journal= {arXiv preprint arXiv:2603.05484},
  year   = {2026}
}