中文

用于层次化嵌入的自适应语义-视觉树

计算机视觉与模式识别 2020-03-10 v1

摘要

商品类别天然地形成一种具有不同概念抽象层次的语义层次结构,尤其对于细粒度类别而言。该层次结构编码了不同层次上各类别之间的丰富关联,可有效正则化语义空间,从而降低预测歧义。然而,先前的细粒度图像检索研究主要关注语义相似度或视觉相似度。在实际应用中,仅使用视觉相似度可能无法满足消费者使用真实图像搜索商品的需求,例如,以一件红色外套作为查询图像,仅基于视觉相似度我们可能在召回结果中得到红色西装,因为它们视觉上相似。但用户实际想要的是外套而非西装,即便外套颜色或纹理属性不同。我们基于实际中的图像编辑应用引入了这一新问题。这正是为何引入语义信息以正则化边界,使“语义”优先于“视觉”。为解决这一新问题,我们提出层次化自适应语义-视觉树(ASVT)来刻画商品类别的体系结构,其同时评估不同语义层次间的语义相似度与同一语义类内的视觉相似度。语义信息满足了消费者对与查询相似商品的需求,而视觉信息优化了语义类内的关联。在每一层,我们基于语义层次设定不同边界并将其作为先验信息以学习细粒度特征嵌入。为评估我们的框架,我们提出了一个名为 JDProduct 的新数据集,其层次标签收集自某在线购物应用中的实际图像查询与官方商品图像。在公开数据集 CARS196 和 CUB- 上的大量实验结果

关键词

引用

@article{arxiv.2003.03707,
  title  = {Adaptive Semantic-Visual Tree for Hierarchical Embeddings},
  author = {Shuo Yang and Wei Yu and Ying Zheng and Hongxun Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2003.03707},
  year   = {2020}
}