中文

基于混合先验生成模型的文档哈希

计算与语言 2019-08-30 v1 信息检索

摘要

由于二值码之间距离评估的高效性,哈希在有大规模信息检索任务中颇具前景。生成式哈希常用于以无监督方式生成哈希码。然而,现有的生成式哈希方法仅考虑使用简单先验,如高斯和伯努利先验,这限制了这些方法进一步提升性能。本文提出两种混合先验生成模型,旨在为文档生成高质量哈希码。具体而言,首先将高斯混合先验施加于变分自编码器(VAE),随后通过独立步骤将 VAE 的连续隐表示转换为二值码。为避免独立转换带来的性能损失,进一步开发了使用伯努利混合先验的模型,其中借助直通(ST)离散梯度估计器实现端到端训练。在多个基准数据集上的实验结果表明,所提方法(尤其是使用伯努利混合先验的方法)始终大幅优于现有方法。

关键词

引用

@article{arxiv.1908.11078,
  title  = {Document Hashing with Mixture-Prior Generative Models},
  author = {Wei Dong and Qinliang Su and Dinghan Shen and Changyou Chen},
  journal= {arXiv preprint arXiv:1908.11078},
  year   = {2019}
}

备注

10 pages, 8 figures, to appear at EMNLP-IJCNLP 2019