多模态嵌入在推荐系统中的真实有效性:整合模式与单一模态的深入分析
信息检索
2026-01-19 v3
摘要
多模态推荐已成为主流范式,通常利用从预训练模型(如 Sentence-BERT、Vision Transformer 和 ResNet)中提取的文本与视觉嵌入。这种方法建立在直观假设之上:融合多模态嵌入可提升推荐性能。然而,尽管广受欢迎,这一假设缺乏全面实证验证。这构成了关键的研究空白。为此,本文提出核心研究问题:多模态嵌入是否真正有益于推荐?为回答此问,我们开展了大规模实证研究,考察文本与视觉嵌入在现代多模态推荐模型中(作为整体及单独各模态)的作用。具体而言,我们提出两个关键问题:(1)整体多模态嵌入是否提升推荐性能?(2)当仅使用单一模态时,文本或视觉模态是否有效?为隔离单一模态的效应(文本或视觉),我们采用模态排除策略,将相应嵌入设置为常数或随机噪声。为保证研究的规模与全面性,我们评估了14个广泛使用的前沿多模态推荐模型。我们的发现表明:(1)整体上,多模态嵌入会提升推荐性能——尤其是在通过更复杂的图基融合模型整合时。意外的是,采用简单融合方案(如 VBPR 和 BM3)的常用基线模型仅获益有限。(2)文本模态单独使用即可在大多数情况下达到相当于完整多模态设置的性能,而视觉模态单独使用则不行。这些结果为多模态推荐社区提供了基础性洞见与实用指导。
引用
@article{arxiv.2508.07399,
title = {Are Multimodal Embeddings Truly Beneficial for Recommendation? A Deep Dive into Whole vs. Individual Modalities},
author = {Yu Ye and Junchen Fu and Yu Song and Kaiwen Zheng and Joemon M. Jose},
journal= {arXiv preprint arXiv:2508.07399},
year = {2026}
}
备注
Accepted by ECIR 2026