多模态嵌入的短视频推荐:解决冷启动和偏置问题
机器学习
2025-09-05 v2
摘要
近年来,社交媒体用户在短视频平台上花费的时间显著增加。因此,其他领域的既有平台(如电子商务)开始引入短视频内容以吸引用户并增加其在平台上的停留时间。这种体验的成功不仅归功于内容本身,也归功于一种独特的 UI 创新:平台主动为用户推荐内容,用户一次只观看一个视频,而不是提供一系列选择供用户点击。这为推荐系统带来了新的挑战,尤其是在引入新的视频体验时。除了有限的交互数据外,沉浸式信息流体验还因 UI 和观看时长偏见而引入更强的位点偏见。当优化观看时长时,模型倾向于偏好较短的视频,这导致这些问题以及推荐系统固有的反馈环�一起,使得构建有效解决方案变得困难。本文我们概述了在引入新的短视频体验时所面临的挑战,并展示了我们的经验表明,即使拥有足够的视频交互数据,使用基于微调的多模态视觉语言模型的视频检索系统来克服这些挑战也更有益处。在我们在电子商务平台上进行的在线实验中,这种方法相对于传统监督学习方法表现更为有效。
引用
@article{arxiv.2507.19346,
title = {Short-Form Video Recommendations with Multimodal Embeddings: Addressing Cold-Start and Bias Challenges},
author = {Andrii Dzhoha and Katya Mirylenka and Egor Malykh and Marco-Andrea Buchmann and Francesca Catino},
journal= {arXiv preprint arXiv:2507.19346},
year = {2025}
}