中文

LinkedOut:将视频大语言模型的世界知识表示链接出来,用于下一代视频推荐

计算机视觉与模式识别 2025-12-19 v1 人工智能 信息检索 机器学习 多媒体

摘要

视频大语言模型(VLLM)通过互联网规模数据的预训练实现了具有世界知识感知能力的视频理解,并在电影分析和视频问答等任务上已展现出潜力。然而,将 VLLM 部署于视频推荐等下游任务仍具有挑战性,因为实际系统需要多视频输入、轻量骨干网络、低延迟顺序推理和快速响应。在实践中,(1)仅解码生成导致顺序推理的高延迟,(2)典型接口不支持多视频输入,(3)将输出约束为语言会丢弃对下游视觉任务重要的细粒度视觉细节。我们认为这些限制源于缺乏一种既能保留像素级细节又能利用世界知识的表示。我们提出了 LinkedOut,一种从视频中提取 VLLM 世界知识的表示,以实现快速推理、支持多视频历史记录并消除语言瓶颈。LinkedOut 使用 VLLM 从原始帧中提取语义化、基于知识的 token,由可提示查询和可选辅助模态引导。我们引入了一种跨层知识融合的专家混合模型(MoE),从丰富的 VLLM 特征中选择适当的抽象层次,实现个性化、可解释且低延迟的推荐。据我们所知,LinkedOut 是首个在原始帧上运行且无需手工标注的基于 VLLM 的视频推荐方法,在标准基准上取得了最先进的结果。可解释性研究和消融实验确认了层多样性和逐层融合的优势,指向了一条充分利用 VLLM 世界知识先验和视觉推理进行推荐等下游视觉任务的实用路径。

关键词

引用

@article{arxiv.2512.16891,
  title  = {LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation},
  author = {Haichao Zhang and Yao Lu and Lichen Wang and Yunzhe Li and Daiwei Chen and Yunpeng Xu and Yun Fu},
  journal= {arXiv preprint arXiv:2512.16891},
  year   = {2025}
}