基于二值化的超高维稀疏表示用于高效文本检索
计算与语言
2021-10-18 v2 信息检索
摘要
神经信息检索的语义匹配能力可改善符号方法中的同义和多义问题。然而,由于效率低下,神经模型的稠密表示更适合用于重排序。符号或潜在形式的稀疏表示借助倒排索引更为高效。结合稀疏与稠密表示的优点,我们提出了一种具备可直接可控稀疏性的超高维(UHD)表示方案。UHD 的大容量以及维度间极小的噪声与干扰,使得二值化表示成为可能,其在存储与搜索上极为高效。我们还提出了一种分桶方法,从 BERT 的多个层中选择/合并嵌入以表征多样的语言层面。我们在 MS MARCO 和 TREC CAR 上测试了我们的模型,表明我们的模型优于其他稀疏模型。
引用
@article{arxiv.2104.07198,
title = {Ultra-High Dimensional Sparse Representations with Binarization for Efficient Text Retrieval},
author = {Kyoung-Rok Jang and Junmo Kang and Giwon Hong and Sung-Hyon Myaeng and Joohee Park and Taewon Yoon and Heecheol Seo},
journal= {arXiv preprint arXiv:2104.07198},
year = {2021}
}
备注
To appear at EMNLP 2021