中文

二次相似性查询的压缩:有限块长与实际方案

信息论 2014-05-13 v2 math.IT

摘要

我们研究了用于相似性识别的压缩问题,其中相似性通过向量间的均方欧几里得距离来衡量。虽然该问题的渐近基本极限(最小压缩率和错误指数)已在先前的工作中找到,但本文专注于非渐近域和实际可实现的方案。我们首先提出了基于形状 - 增益量化的有限块长可达界:向量的增益(幅度)通过标量化进行压缩,而形状(在单位球上的投影)则使用球码进行量化。数值评估了这些结果,并且它们如错误指数所预测的那样收敛于渐近值。随后,我们给出了任何压缩方案性能的非渐近下界,并将其与上界(可达界)进行比较。对于此类方案的实际实现,我们使用了 Hamkins 和 Zeger 研究的包裹球码,并以 Leech 格为例作为底层格。作为一个附带结果,我们获得了任何包裹球码的覆盖角关于底层格覆盖半径的界限。

关键词

引用

@article{arxiv.1404.5173,
  title  = {Compression for Quadratic Similarity Queries: Finite Blocklength and Practical Schemes},
  author = {Fabian Steiner and Steffen Dempfle and Amir Ingber and Tsachy Weissman},
  journal= {arXiv preprint arXiv:1404.5173},
  year   = {2014}
}

备注

minor clarifications and wording updates compared to v1