中文

理解MLLMs处理视频流事件的记忆与混淆现象

计算机视觉与模式识别 2025-02-24 v1

摘要

多模态大语言模型 (MLLMs) 在整体上理解视频方面已显示出强大的性能,但其处理流式视频的能力——视频被视为视觉事件的序列——仍未得到充分探索。直观地,利用过去的事件作为记忆可以丰富对当前事件的上下文和时间理解。在本文中,我们表明,利用记忆作为上下文有助于 MLLMs 更好地理解视频事件。然而,由于此类记忆依赖于前导事件的预测,可能包含错误信息,导致混淆并降低性能。为解决此问题,我们提出了一种混淆感知的记忆修改方法,用于消除记忆中混淆的记忆,以增强事件理解。

关键词

引用

@article{arxiv.2502.15457,
  title  = {Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs},
  author = {Gengyuan Zhang and Mingcong Ding and Tong Liu and Yao Zhang and Volker Tresp},
  journal= {arXiv preprint arXiv:2502.15457},
  year   = {2025}
}

备注

Short paper (5 pages)