中文

图像不撒谎:将深度视觉语义特征迁移至大规模多模态排序学习

计算机视觉与模式识别 2015-11-23 v1 机器学习

摘要

搜索是现代电子商务的核心。因此,自动对搜索结果进行排序的任务(排序学习)是一个价值数十亿美元的机器学习问题。传统模型基于物品文本的手工构造特征进行优化。本文引入一种多模态排序学习模型,将这些传统特征与从深度卷积神经网络迁移而来的视觉语义特征相结合。利用来自在线市场Etsy的数据进行大规模实验,我们验证了转向多模态表示显著提升了排序质量。我们展示了图像特征如何捕捉文本仅表示中不可用的细粒度风格信息。此外,我们给出了具体示例,说明图像信息如何成功解开那些被仅文本模型排为相似但差异极大的物品对。

关键词

引用

@article{arxiv.1511.06746,
  title  = {Images Don't Lie: Transferring Deep Visual Semantic Features to Large-Scale Multimodal Learning to Rank},
  author = {Corey Lynch and Kamelia Aryafar and Josh Attenberg},
  journal= {arXiv preprint arXiv:1511.06746},
  year   = {2015}
}

备注

9 pages, 6 figures