中文

VidPrism:面向图像到视频迁移的异构专家混合模型

计算机视觉与模式识别 2026-05-28 v1 人工智能

摘要

随着预训练技术的快速发展,针对视频理解(即图像到视频迁移学习)适配大规模视觉语言模型(VLM)已成为主导范式。要实现卓越性能,近期研究的有效策略是采用混合专家(Mixture-of-Experts, MoE)来增强VLM的时序建模能力。然而,传统MoE设计存在专家同质化问题,即所有专家都充当相同的通用专家,效率低下,无法从未经区分的视频流中学习时空特征。为克服此问题,我们提出VidPrism,一种新的异构时序混合专家框架。VidPrism首次通过部署功能专门化的专家实现分工合作,每个专家承担从空间理解到时序建模的不同角色。为合理分配这些专家, 我们引入一种内容感知的多速率采样模块,动态生成从语义丰富到运动聚焦的表示流,为专家提供专业化输入。此外,一种动态的双向融合机制促进这些路径之间的协同信息交换,形成全面的视频表征。广泛的实验表明,VidPrism在各种视频识别基准上实现了最新成果,并有效促进了专家的专业化。我们的源代码可在\href{https://github.com/Lrrrr549/VidPrism.git}{https://github.com/Lrrrr549/VidPrism.git}获取。

关键词

引用

@article{arxiv.2605.28229,
  title  = {VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer},
  author = {Rui Lin and Chuanming Wang and Huadong Ma},
  journal= {arXiv preprint arXiv:2605.28229},
  year   = {2026}
}

备注

CVPR2026 camera ready