VideoPrism:一种用于视频理解的基础视觉编码器
计算机视觉与模式识别
2025-06-10 v3 人工智能
摘要
我们推出了 VideoPrism,这是一种通用的视频编码器,能够通过单个冻结模型处理多样化的视频理解任务。我们在一个异构语料库上对 VideoPrism 进行了预训练,该语料库包含 3600 万对高质量视频 - 字幕对和 5.82 亿个带有噪声并行文本(例如 ASR 转录稿)的视频片段。该预训练方法通过语义视频嵌入的全局 - 局部蒸馏和令牌洗牌方案改进了掩码自编码,使 VideoPrism 能够主要关注视频模态,同时利用与视频相关的宝贵文本。我们在四大类视频理解任务上广泛测试了 VideoPrism,从网络视频问答到科学领域的计算机视觉,在 33 个视频理解基准测试中的 31 个上实现了最先进(SOTA)的性能。我们的模型已发布于 https://github.com/google-deepmind/videoprism。
引用
@article{arxiv.2402.13217,
title = {VideoPrism: A Foundational Visual Encoder for Video Understanding},
author = {Long Zhao and Nitesh B. Gundavarapu and Liangzhe Yuan and Hao Zhou and Shen Yan and Jennifer J. Sun and Luke Friedman and Rui Qian and Tobias Weyand and Yue Zhao and Rachel Hornung and Florian Schroff and Ming-Hsuan Yang and David A. Ross and Huisheng Wang and Hartwig Adam and Mikhail Sirotenko and Ting Liu and Boqing Gong},
journal= {arXiv preprint arXiv:2402.13217},
year = {2025}
}
备注
Accepted to ICML 2024. v2: added retrieval results on MSRVTT (1K-A), more data analyses, and ablation studies; v3: released models at https://github.com/google-deepmind/videoprism