中文

基于二值化的超高维稀疏表示用于高效文本检索

计算与语言 2021-10-18 v2 信息检索

摘要

神经信息检索的语义匹配能力可改善符号方法中的同义和多义问题。然而,由于效率低下,神经模型的稠密表示更适合用于重排序。符号或潜在形式的稀疏表示借助倒排索引更为高效。结合稀疏与稠密表示的优点,我们提出了一种具备可直接可控稀疏性的超高维(UHD)表示方案。UHD 的大容量以及维度间极小的噪声与干扰,使得二值化表示成为可能,其在存储与搜索上极为高效。我们还提出了一种分桶方法,从 BERT 的多个层中选择/合并嵌入以表征多样的语言层面。我们在 MS MARCO 和 TREC CAR 上测试了我们的模型,表明我们的模型优于其他稀疏模型。

关键词

引用

@article{arxiv.2104.07198,
  title  = {Ultra-High Dimensional Sparse Representations with Binarization for Efficient Text Retrieval},
  author = {Kyoung-Rok Jang and Junmo Kang and Giwon Hong and Sung-Hyon Myaeng and Joohee Park and Taewon Yoon and Heecheol Seo},
  journal= {arXiv preprint arXiv:2104.07198},
  year   = {2021}
}

备注

To appear at EMNLP 2021