中文

MILDNet: 一种轻量级单尺度深度排序架构

计算机视觉与模式识别 2019-03-15 v2 人工智能 信息检索 机器学习

摘要

多尺度深度 CNN 架构 [1, 2, 3] 成功地为视觉相似度任务捕获了细粒度和粗粒度级别的图像描述符,但它们带来了昂贵的内存开销和延迟。在本文中,我们提出了一种极具竞争力的新型 CNN 架构,称为 MILDNet,其优点在于极为紧凑(约 3 倍)。受到连续 CNN 层以递增的抽象级别表示图像这一事实的启发,我们通过将多个中间层与最后一层的激活耦合,将深度排序模型压缩为单个 CNN。在著名的 Street2shop 数据集 [4] 上进行训练,我们证明了我们的方法仅需三分之一的参数、模型大小和训练时间,且推理时间显著减少,其性能即可与当前 SOTA 模型相媲美。中间层在图像检索任务中的重要性也在流行的 Holidays、Oxford、Paris 数据集 [5] 上得到了验证。因此,尽管我们的实验是在电子商务领域进行的,但它同样适用于其他领域。我们进一步进行了消融研究,通过检查添加每个中间层的影响来验证我们的假设。借此,我们还提出了 MILDNet 的另外两个有用变体:一个用于边缘设备的移动模型(小 12 倍)和一个用于内存较少系统并降低排序成本的紧凑特征模型(512 维特征嵌入)。此外,我们提出了一种直观的方法来自动创建定制的内部三元组训练数据集,这种方法很难手动创建。该解决方案也可以部署为一个全方位的视觉相似度解决方案。最后,我们展示了目前为 Fynd 提供视觉相似度支持的完整生产级架构。

关键词

引用

@article{arxiv.1903.00905,
  title  = {MILDNet: A Lightweight Single Scaled Deep Ranking Architecture},
  author = {Anirudha Vishvakarma},
  journal= {arXiv preprint arXiv:1903.00905},
  year   = {2019}
}

备注

12 pages, 11 figures