ViLL-E:用于检索的视频 LLM 嵌入
计算机视觉与模式识别
2026-04-15 v1
摘要
视频大型语言模型(VideoLLM)在输出为文本的视频理解任务中表现出色,例如视频问答和视频描述。然而,在检索任务(如文本到视频检索和时段检索)中却不及专门的嵌入模型。我们引入 ViLL-E(Video-LLM-Embed),一种统一的 VideoLLM 架构,具备新颖的嵌入生成机制,使模型能够为复杂视频“思考更久”,而对简单视频提前停止。我们采用三阶段训练方法结合生成式和对比学习:首先进行大规模预训练使用视频-描述配对;随后在较小的详细描述数据集上进行持续训练;最后在覆盖视频问答、时序局部化、视频检索和视频文本匹配的新型多任务数据集上进行任务特定微调。我们的模型在时序局部化(平均提升 7%)和视频检索(提升最高 4%)方面显著优于其他 VideoLLM,达到与领先的专门嵌入模型相当的性能,同时在视频问答任务中保持竞争力。此外,我们的联合对比-生成训练 unlocks 新的零样本能力,在组合视频检索(超越 SotA 5%)和从长文本检索(超越 SotA 2%)方面显著优于最先进的方法。
引用
@article{arxiv.2604.12148,
title = {ViLL-E: Video LLM Embeddings for Retrieval},
author = {Rohit Gupta and Jayakrishnan Unnikrishnan and Fan Fei and Sheng Liu and Son Tran and Mubarak Shah},
journal= {arXiv preprint arXiv:2604.12148},
year = {2026}
}
备注
Accepted at ACL 2026 Main conference