中文

VidVec: 解锁视频多模态大语言模型嵌入用于视频-文本检索

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

最近的研究已将生成式多模态大语言模型(MLLM)适配为视觉任务的嵌入提取器,通常通过微调来产生通用表示。然而,它们在视频上的性能仍然不如视频基础模型(VFM)。在本文中,我们专注于利用MLLM进行视频-文本嵌入和检索。我们首先进行系统的逐层分析,表明中间(预训练)MLLM层已经编码了大量任务相关信息。利用这一见解,我们证明将中间层嵌入与校准的MLLM头部相结合,可以在无需任何训练的情况下产生强大的零样本检索性能。基于这些发现,我们引入了一种轻量级的基于文本的对齐策略,该策略将密集的视频字幕映射为简短摘要,并能够在没有视觉监督的情况下学习与任务相关的视频-文本嵌入。值得注意的是,除了文本之外无需任何微调,我们的方法以显著的优势超越了当前方法,在常见的视频检索基准上取得了最先进的结果。

关键词

引用

@article{arxiv.2602.08099,
  title  = {VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval},
  author = {Issar Tzachor and Dvir Samuel and Rami Ben-Ari},
  journal= {arXiv preprint arXiv:2602.08099},
  year   = {2026}
}

备注

Project page: https://iyttor.github.io/VidVec/