video-SALMONN S:内存增强的流式音视频大语言模型
计算机视觉与模式识别
2026-02-04 v2 人工智能
摘要
长时段视频理解是未来AI智能体的基本能力,但因长期记忆效果不佳而受限。我们引入video-SALMONN S,一种内存增强的流式音视频大语言模型,能够在1FPS和360p分辨率下处理超过3小时的视频,优于在相同内存预算下的强大非流式模型。除Token合并或下采样外,video-SALMONN S是首次采用测试时训练(TTT)作为视频理解的流式记忆机制。TTT持续将短期多模态表示转化为嵌入模型参数中的长期记忆。为提高长程依赖建模和记忆容量,我们提出(i)带额外长程预测目标的TTT_MEM层、(ii)两阶段训练方案、(iii)模态感知记忆读取器。我们进一步引入Episodic Learning from Video Memory(ELViM)基准,模拟代理人场景,其中模型必须从数小时前观察的视频中学习。video-SALMONN S在长视频基准测试中 consistently 超过流式和非流式基线3-7%。值得注意的是,video-SALMONN S在ELViM上实现了超过强大非流式模型的15%绝对准确率提升,展示了强大的视频记忆学习能力。
引用
@article{arxiv.2510.11129,
title = {video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM},
author = {Guangzhi Sun and Yixuan Li and Xiaodong Wu and Yudong Yang and Wei Li and Zejun Ma and Chao Zhang},
journal= {arXiv preprint arXiv:2510.11129},
year = {2026}
}