相似性信息论
信息论
2025-12-02 v1 数据结构与算法
信息检索
机器学习
math.IT
摘要
我们在 witness 基相似性系统 (REWA) 与香浓信息论之间建立了精确的数学等价。我们证明了 witness 重叠是互信息,REWA 位复杂度限制源于信道容量限制,保持排序的编码遵循率失真约束。这种统一揭示了五十年相似性搜索研究——从 Bloom 过滤器到局部敏感哈希到神经检索——隐式发展了关系数据的信息论。我们推导了基本下界,表明 REWA 的 复杂度是最优的:没有任何编码方案能够用更少的位数来保持相似性排序。该框架表明,语义相似性具有物理单位(互信息的位数),搜索是通信(查询通过噪声信道传输),检索系统面临基本的容量限制,类似于香浓信道编码定理。
引用
@article{arxiv.2512.00378,
title = {The Information Theory of Similarity},
author = {Nikit Phadke},
journal= {arXiv preprint arXiv:2512.00378},
year = {2025}
}