利用图驱动生成模型融合语义与邻域信息用于文档检索
信息检索
2021-05-28 v1 人工智能
摘要
由于对快速检索速度和小内存占用的需求,文档哈希在大规模信息检索中发挥着关键作用。为生成高质量哈希码,语义与邻域信息均至关重要。然而,大多数现有方法仅利用其中之一或通过某些直观准则简单组合,缺乏指导融合过程的理论原则。在本文中,我们用图诱导的高斯分布编码邻域信息,并提出用图驱动生成模型融合这两类信息。为处理文档间复杂的相关性,我们进一步提出一种树结构近似学习方法。在该近似下,我们证明训练目标可分解为仅涉及单篇或成对文档的项,使模型能像不相关情形一样高效训练。在三个基准数据集上的大量实验结果表明,我们的方法优于最先进的方法,证明了所提模型在同时保留语义与邻域信息方面的有效性。
引用
@article{arxiv.2105.13066,
title = {Integrating Semantics and Neighborhood Information with Graph-Driven Generative Models for Document Retrieval},
author = {Zijing Ou and Qinliang Su and Jianxing Yu and Bang Liu and Jingwen Wang and Ruihui Zhao and Changyou Chen and Yefeng Zheng},
journal= {arXiv preprint arXiv:2105.13066},
year = {2021}
}