AdaCM$^2$:基于自适应跨模态记忆缩减的超长视频理解
计算机视觉与模式识别
2025-04-07 v3 人工智能
摘要
大语言模型(LLM)的进步通过将 LLM 与视觉模型结合,推动了视频理解任务的提升。然而,大多数现有的基于 LLM 的模型(例如 VideoLLaMA、VideoChat)仅限于处理短视频。近期的尝试通过提取视觉特征并将其压缩为固定大小的记忆来理解长视频。尽管如此,这些方法仅利用视觉模态来合并视频 token,忽略了视觉与文本查询之间的相关性,导致难以有效处理复杂的问答任务。为了应对长视频与复杂提示的挑战,我们提出了 AdaCM,其首次在视频流上以自回归方式引入了一种自适应跨模态记忆缩减方法用于视频-文本对齐。我们在视频描述、视频问答和视频分类等多种视频理解任务上进行了大量实验,结果表明 AdaCM 在多个数据集上取得了 SOTA 性能,同时显著降低了内存使用。值得注意的是,在 LVU 数据集的多个任务中实现了 4.5% 的提升,且 GPU 内存消耗降低了高达 65%。
引用
@article{arxiv.2411.12593,
title = {AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction},
author = {Yuanbin Man and Ying Huang and Chengming Zhang and Bingzhe Li and Wei Niu and Miao Yin},
journal= {arXiv preprint arXiv:2411.12593},
year = {2025}
}
备注
CVPR 2025 Highlight