Tries 的新熵度量及其在 XBWT 中的应用
数据结构与算法
2025-12-15 v1
摘要
熵度量在特定假设下衡量对象存储所需的位数。虽然字符串领域的熵概念已为人所熟知,但在 Tries 语境下,关于熵的研究相对不成熟。标准 Tries 最坏情况熵考虑具有固定节点数和字母表大小的 Tries 集合,但该方法未考虑符号在 Tries 中的频率,因而无法捕捉字符分布不均的 Tries 的压缩性。另一方面,针对节点标记树提出的标签熵[FOCS '05]未考虑树的拓扑结构,这些结构需单独存储。在本文中,我们引入两种新的 Tries 熵度量——最坏情况熵和经验熵——克服了上述两个局限性。值得注意的是,我们的熵度量满足其字符串对应项的类似性质,因而成为更自然的(更简单)字符串情形的推广。事实上,我们的经验熵与最坏情况熵密切相关,可通过从字符串自然推广的算术编码实现。此外我们表明,类似于针对字符串的 FM-index [JACM '05],XBWT 可在我们的 k 阶经验熵加上 o(n) 位的范围内进行压缩和高效索引,其中 n 为节点数。有趣的是,该编码的空间使用包括 Tries 的拓扑结构,且上界对所有足够小的 k 同时成立。该 XBWT 编码始终严格小于原始编码[ JACM '09],我们还展示在某些情况下其渐近上界更小。
引用
@article{arxiv.2512.11618,
title = {New Entropy Measures for Tries with Applications to the XBWT},
author = {Lorenzo Carfagna and Carlo Tosoni},
journal= {arXiv preprint arXiv:2512.11618},
year = {2025}
}
备注
32 pages, 4 figures