中文

半监督多模态哈希

信息检索 2017-12-12 v1

摘要

在多个模态中检索相关数据(如 Facebook 上的图文对与 YouTube 上的视频-标签对)的最近邻,由于数据量巨大已成为一项具有挑战性的任务。将数据进行二进制编码嵌入的多模态哈希方法可提升检索速度并降低存储需求。由于无监督多模态哈希方法通常劣于有监督方法,而有监督方法需要过多人工标注数据,本文提出的方法利用部分标签来设计一种半监督多模态哈希方法。该方法首先计算数据矩阵与标签矩阵的变换矩阵。然后,利用这些变换矩阵引入模糊逻辑来估计未标注数据的标签矩阵。最后,利用估计的标签矩阵学习各模态数据的哈希函数以生成统一的二进制码矩阵。实验表明,所提半监督方法在使用 50% 标签时,性能处于所比较的有监督方法的中等水平,并在使用 90% 标签时达到最佳有监督方法的近似性能。仅使用 10% 标签时,该方法仍可与最差的有比较对象的有监督方法相竞争。

关键词

引用

@article{arxiv.1712.03404,
  title  = {Semi-supervised Multimodal Hashing},
  author = {Dayong Tian and Maoguo Gong and Deyun Zhou and Jiao Shi and Yu Lei},
  journal= {arXiv preprint arXiv:1712.03404},
  year   = {2017}
}