将多模态引入 Amazon 视觉搜索系统
计算机视觉与模式识别
2024-12-19 v1
摘要
图像到图像匹配在计算机视觉领域已被广泛研究。以往的研究主要集中于训练深度度量学习模型,以匹配查询图像与图库图像之间的视觉模式。在本研究中,我们表明纯图像到图像匹配会因匹配局部视觉模式而产生假阳性。为缓解此问题,我们提出利用视觉-语言预训练研究的最新进展。具体而言,我们将额外的图像-文本对齐损失引入深度度量学习,作为对图像到图像匹配损失的约束。通过文本(例如产品标题)与图像对之间的额外对齐,模型能够显式地从两种模态中学习概念,从而避免匹配低级视觉特征。我们逐步开发了两个变体:三塔模型和四塔模型,后者额外接收一个短文本查询输入。通过大量实验,我们表明这一改变为图像到图像匹配问题带来了显著提升。我们进一步将该模型用于多模态搜索,同时接收图像和重构文本查询以提升搜索质量。离线和在线实验均在主要指标上展现出显著提升。具体而言,三塔模型使图像匹配点击率相对提升了 4.95%,四塔模型进一步提升了 1.13%。
引用
@article{arxiv.2412.13364,
title = {Bringing Multimodality to Amazon Visual Search System},
author = {Xinliang Zhu and Michael Huang and Han Ding and Jinyu Yang and Kelvin Chen and Tao Zhou and Tal Neiman and Ouye Xie and Son Tran and Benjamin Yao and Doug Gray and Anuj Bindal and Arnab Dhua},
journal= {arXiv preprint arXiv:2412.13364},
year = {2024}
}