理解MLLMs处理视频流事件的记忆与混淆现象
计算机视觉与模式识别
2025-02-24 v1
摘要
多模态大语言模型 (MLLMs) 在整体上理解视频方面已显示出强大的性能,但其处理流式视频的能力——视频被视为视觉事件的序列——仍未得到充分探索。直观地,利用过去的事件作为记忆可以丰富对当前事件的上下文和时间理解。在本文中,我们表明,利用记忆作为上下文有助于 MLLMs 更好地理解视频事件。然而,由于此类记忆依赖于前导事件的预测,可能包含错误信息,导致混淆并降低性能。为解决此问题,我们提出了一种混淆感知的记忆修改方法,用于消除记忆中混淆的记忆,以增强事件理解。
引用
@article{arxiv.2502.15457,
title = {Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs},
author = {Gengyuan Zhang and Mingcong Ding and Tong Liu and Yao Zhang and Volker Tresp},
journal= {arXiv preprint arXiv:2502.15457},
year = {2025}
}
备注
Short paper (5 pages)