VL-CLIP:通过视觉 grounding 与 LLM 增强的 CLIP 嵌入提升多模态推荐
信息检索
2025-07-24 v1 人工智能
计算机视觉与模式识别
摘要
多模态学习在今天的电商推荐平台中扮演着关键角色,能够实现精准的推荐和产品理解。然而,现有的视觉语言模型,如 CLIP,在电商推荐系统中面临着三个关键挑战:1)弱的对象级对齐,全局图像嵌入无法捕获细粒度的产品属性,导致检索性能次优;2)模糊的文本表征,产品描述往往缺乏上下文清晰度,影响跨模态匹配;3)领域不匹配,通用视觉语言模型可能难以适用于电商特定数据。为此,我们提出了名为 VL-CLIP 的框架,通过集成视觉 grounding 实现细粒度视觉理解,以及基于 LLM 的代理人生成丰富的文本嵌入来增强 CLIP 嵌入。视觉 grounding 通过定位关键产品来细化图像表征,而 LLM 代理人通过消除歧义的产品描述来增强文本特征。我们的方法在美国最大电商平台上显著提升了检索准确率、多模态检索效果和推荐质量,分别将 CTR 提升 18.6%、ATC 提升 15.5%、GMV 提升 4.0%。额外的实验结果表明,我们的框架在精度和语义对齐方面优于包括 CLIP、FashionCLIP 和 GCL 在内的视觉语言模型,展示了结合对象感知视觉 grounding 与 LLM 增强文本表征以实现稳健多模态推荐的潜力。
引用
@article{arxiv.2507.17080,
title = {VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings},
author = {Ramin Giahi and Kehui Yao and Sriram Kollipara and Kai Zhao and Vahid Mirjalili and Jianpeng Xu and Topojoy Biswas and Evren Korpeoglu and Kannan Achan},
journal= {arXiv preprint arXiv:2507.17080},
year = {2025}
}
备注
Accepted at RecSys 2025; DOI:https://doi.org/10.1145/3705328.3748064