中文

面向半监督哈希的自监督伯努利自编码器

机器学习 2023-08-11 v1 机器学习

摘要

语义哈希是一种基于用保持相似性的二进制码表示高维数据以实现高效索引与检索的大规模相似性搜索新兴技术。近期研究表明,具有由神经网络参数化的伯努利隐表示的变分自编码器,可在监督与无监督场景下成功训练以学习此类码,并凭借其在架构上处理二进制约束的能力优于更传统的方法。然而,标签稀缺的场景尚未被研究。本文考察基于变分自编码器的哈希方法对缺乏监督的鲁棒性,聚焦于当前使用的两种半监督方法。第一种扩充变分自编码器的训练目标以联合建模数据分布与类标签分布。第二种方法利用标注定义额外的成对损失,强制码(汉明)空间中的相似性与标签空间中的相似性一致。我们的实验表明两种方法均能显著提升哈希码质量。当标注点数量大时,成对方法可展现优势;但我们发现该方法随标注样本减少迅速退化并丧失优势。为规避此问题,我们提出一种新颖监督方法,其中模型利用其标签分布预测来实现成对目标。相较最佳基线,该过程在全监督设定下取得相近性能,但在标注数据稀缺时显著改善结果。我们的代码已公开于 https://github.com/amacaluso/SSB-VAE。

关键词

引用

@article{arxiv.2007.08799,
  title  = {Self-Supervised Bernoulli Autoencoders for Semi-Supervised Hashing},
  author = {Ricardo Ñanculef and Francisco Mena and Antonio Macaluso and Stefano Lodi and Claudio Sartori},
  journal= {arXiv preprint arXiv:2007.08799},
  year   = {2023}
}

备注

8 pages, 2 figures