描绘信息流动之路:揭示 VideoLLM 中隐含的路径
计算机视觉与模式识别
2026-03-04 v2
摘要
Video 大语言模型(VideoLLM)将视觉语言模型的能力扩展到时空输入,使其能够完成视频问答(VideoQA)等任务。尽管近期在 VideoLLM 方面取得了进展,但它们在提取和传递视频与文本信息的内部机制仍不为人所了解。本研究利用机制性可解释性技术探讨 VideoLLM 的内部信息流动。我们的分析在 diverse VideoQA 任务中揭示了一致的模式:(1) VideoLLM 的时序推理始于早至中期层的主动跨帧相互作用,(2) 随后在中期层进行视频-语言整合。这一过程通过视频表征与包含时序概念的语言嵌入之间的对齐实现。(3) 在完成此整合后,模型准备在中期至晚期层中生成正确答案。(4) 根据我们的分析,我们展示了 VideoLLM 通过选择这些有效信息路径来保持其 VideoQA 性能,同时抑制大量注意力边缘,例如在 LLaVA-NeXT-7B-Video-FT 中抑制了 58%。这些发现为 VideoLLM 如何进行时序推理提供了蓝图,并为改进模型可解释性和下游泛化性提供了实用见解。我们的项目页面已公开,附有源码链接:https://map-the-flow.github.io
引用
@article{arxiv.2510.13251,
title = {Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs},
author = {Minji Kim and Taekyung Kim and Bohyung Han},
journal= {arXiv preprint arXiv:2510.13251},
year = {2026}
}
备注
ICLR 2026, 32 pages, 39 figures, 8 tables