中文

通过互信息最大化精炼 BERT 嵌入用于文档哈希

信息检索 2021-09-08 v1

摘要

现有的无监督文档哈希方法大多建立在生成模型之上。由于难以捕捉长依赖结构,这些方法很少直接对原始文档建模,而是对从文档中提取的特征(例如词袋(BOW)、TFIDF)建模。在本文中,我们提出从 BERT 嵌入中学习哈希码,此前我们观察到 BERT 在下游任务上取得了巨大成功。作为首次尝试,我们修改现有的生成式哈希模型以适应 BERT 嵌入。然而,相较于从旧有的 BOW 或 TFIDF 特征学习的哈希码,改进甚微。我们将此归因于生成式哈希中的重构要求,它会迫使 BERT 嵌入中大量存在的无关信息也被压缩进哈希码中。为补救该问题,进一步提出了一种基于互信息(MI)最大化原理的新型无监督哈希范式。具体而言,该方法首先从文档构造恰当的全局与局部哈希码,然后寻求最大化它们的互信息。在三个基准数据集上的实验结果表明,所提方法能够生成哈希码,以显著优势超越现有从 BOW 特征学习的哈希码。

关键词

引用

@article{arxiv.2109.02867,
  title  = {Refining BERT Embeddings for Document Hashing via Mutual Information Maximization},
  author = {Zijing Ou and Qinliang Su and Jianxing Yu and Ruihui Zhao and Yefeng Zheng and Bang Liu},
  journal= {arXiv preprint arXiv:2109.02867},
  year   = {2021}
}