PinCLIP:来自 Pinterest 的大规模基础多模态表示
计算机视觉与模式识别
2026-03-05 v1
摘要
尽管多模态视觉语言模型(VLM)在各个领域显示出显著的成功,但将 VLM 集成到推荐和检索系统中仍然是一个挑战,due to training objective discrepancies and serving efficiency bottlenecks。本文介绍了 PinCLIP,一种开发的大规模视觉表示学习方法,用于增强 Pinterest 上的检索和排序模型,通过利用 VLM 来学习图像-文本对齐。我们提出了一种新型混合 Vision Transformer 架构,利用 VLM backbone 和混合融合机制在不同粒度上捕获多模态内容表示。除了标准的图像到文本对齐目标之外,我们引入邻接对齐目标以建模 Pinterest Pin-Board 图中的多模态表示的 cross-fusion。离线评估显示,PinCLIP 在多模态检索任务中超过了如 Qwen 等最先进的基准,提高了 20%。在线 A/B 测试显示出显著的业务影响,包括在 Pinterest 的所有主要表面上实现显著的参与度提升。值得注意的是,PinCLIP 显著解决了“冷启动”问题,增强了 fresh content distribution,带来 15% 的 Repin 提升(有机内容)和 8.7% 更高的点击率(新广告)。
引用
@article{arxiv.2603.03544,
title = {PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest},
author = {Josh Beal and Eric Kim and Jinfeng Rao and Rex Wu and Dmitry Kislyuk and Charles Rosenberg},
journal= {arXiv preprint arXiv:2603.03544},
year = {2026}
}