中文

用于微视频推荐的冻结大型视觉语言模型:特征提取与融合的系统性研究

信息检索 2026-05-06 v2 多媒体

摘要

冻结的大型视频语言模型 (LVLM) 因其强大的多模态理解能力,越来越多地被用于微视频推荐。然而,它们的集成缺乏系统的实证评估:从业者通常将 LVLM 部署为固定的黑盒特征提取器,而没有系统地比较替代的表示策略。为了弥补这一差距,我们沿着两个关键设计维度进行了首次系统的实证研究:(i) 与 ID 嵌入的集成策略,特别是替换与融合;(ii) 特征提取范式,比较 LVLM 生成的字幕与中间解码器隐藏状态。在代表性 LVLM 上的大量实验揭示了三个关键原则:(1) 中间隐藏状态始终优于基于字幕的表示,因为自然语言摘要不可避免地丢弃了对推荐至关重要的细粒度视觉语义;(2) ID 嵌入捕获不可替代的协同信号,使得融合严格优于替换;(3) 中间解码器特征的有效性在不同层之间差异显著。在这些见解的指导下,我们提出了双特征融合 (DFF) 框架,这是一种轻量级即插即用的方法,将来自冻结 LVLM 的多层表示与物品 ID 嵌入自适应融合。DFF 在两个真实世界的微视频推荐基准上取得了 SOTA 性能,始终优于强基线,并为将现成的大型视觉语言模型集成到微视频推荐系统中提供了一种有原则的方法。

关键词

引用

@article{arxiv.2512.21863,
  title  = {Frozen LVLMs for Micro-Video Recommendation: A Systematic Study of Feature Extraction and Fusion},
  author = {Huatuan Sun and Yunshan Ma and Changguang Wu and Yanxin Zhang and Pengfei Wang and Xiaoyu Du},
  journal= {arXiv preprint arXiv:2512.21863},
  year   = {2026}
}

备注

10 pages, 5 figures