利用多模态大语言模型描述观察内容以提升视频推荐效果
信息检索
2025-08-14 v1 计算机视觉与模式识别
摘要
现有的视频推荐系统主要依赖于用户定义的元数据或由专用编码器提取的低级视觉和声学信号。这些低级特征描述屏幕上出现的事物,但无法捕捉意图、幽默感及世界知识等深层语义——这些因素决定了短片是否能引发观众共鸣。例如,30 秒的短片是单纯的屋顶歌手,还是在土耳其卡帕多奇亚的奇妙石林中拍摄的讽刺式歌手剪辑?这类区别对于个性化推荐至关重要,却在传统编码管道中难以捕获。本文提出一种简单且独立于推荐系统的零微调框架,通过提示即插即用的多模态大语言模型(MLLM)为每个短片生成丰富的自然语言描述(例如:“一段超级英雄讽刺片段,包含滑稽的搏斗和管弦乐的尖锐声部”),从而弥合原始内容与用户意图之间的鸿沟。我们将 MLLM 的输出与最先进的文本编码器结合,并输入标准的协同过滤、基于内容和生成式推荐模型中。在模拟用户与 TikTok 风格视频互动的 MicroLens-100K 数据集上,我们的方法在五个代表性模型中持续超越传统的视频、音频和元数据特征。我们的发现凸显了将 MLLMs 作为即时知识提取器以构建更具意图感知能力的视频推荐系统的潜力。
引用
@article{arxiv.2508.09789,
title = {Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations},
author = {Marco De Nadai and Andreas Damianou and Mounia Lalmas},
journal= {arXiv preprint arXiv:2508.09789},
year = {2025}
}