HY-Himmel 技术报告:面向长视频理解的分层交错多流运动编码
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
使用多模态语言模型进行长视频理解面临三个叠加的瓶颈:获取密集 RGB 帧的高昂解码成本、随帧数二次增长的令牌数量,以及在稀疏关键帧采样下较弱的运动感知。我们提出 HY-Himmel,一个分层视频-语言框架,将语义和运动容量分开分配。一小部分稀疏的锚点 I 帧被路由到计算成本高昂的主干 ViT,以建立目标身份和场景布局的基础,而密集得多的帧间间隔则由一个轻量级的压缩域三流适配器进行编码,该适配器从运动矢量图、残差图和 I 帧上下文中提取运动证据,并将其转化为对齐的运动令牌。这些令牌通过一个可微的占位符机制注入到大语言模型(LLM)中,此前经过一个专用的第一阶段对比对齐,将运动表示置于与冻结的视觉主干几何兼容的空间中。在 Video-MME 上,HY-Himmel 以 3.6 倍少的上下文令牌,超越了密集 32 帧基线 2.3 个百分点(从 61.2% 到 63.5%)。关于流组成、运动编码器家族、融合模式、对齐目标、锚点数量、LoRA 秩和视频时长的广泛消融研究证实,完整的三流结构对于观察到的增益是必要且充分的。
引用
@article{arxiv.2605.08158,
title = {HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding},
author = {Haopeng Jin and Hongzhu Yi and Wenlong Zhao and Jinwen Luo and Shani Ye and Zhenyu Guan and Shiquan Dong and Tiankun Yang and Tao Yu},
journal= {arXiv preprint arXiv:2605.08158},
year = {2026}
}
备注
59 pages, 42 figures. Technical report