中文

LZ77 型解析的比较

信息论 2018-05-24 v3 math.IT

摘要

我们研究了文献中现有的不同 LZ77 解析变体之间的关系。所有这些变体均被定义为贪心构造的解析,通过引用输入中较早出现的字符串来编码每个短语。它们的区别在于短语编码方式:由对(长度 + 较早出现的位置)编码,或由三元组(长度 + 较早出现的位置 + 较早出现部分之后的字母)编码;以及是否允许短语与其较早出现部分之间存在重叠。对于大小为 σ\sigma 的字母表上长度为 nn 的给定字符串,用 zz(分别地,z^\hat{z})表示允许(分别地,不允许)重叠的“对”解析中的短语数,用 z3z_3(分别地,z^3\hat{z}_3)表示“三元组”解析中的短语数。我们证明了以下界限,并提供了一系列示例表明这些界限是紧的:\bullet zz^zO(lognzlogσz)z \le \hat{z} \le z \cdot O(\log\frac{n}{z\log_\sigma z})z3z^3z3O(lognz3logσz3)z_3 \le \hat{z}_3 \le z_3 \cdot O(\log\frac{n}{z_3\log_\sigma z_3})\bullet 12z^<z^3z^\frac{1}2\hat{z} < \hat{z}_3 \le \hat{z}12z<z3z\frac{1}2 z < z_3 \le z

关键词

引用

@article{arxiv.1708.03558,
  title  = {Comparison of LZ77-type Parsings},
  author = {Dmitry Kosolobov and Arseny M. Shur},
  journal= {arXiv preprint arXiv:1708.03558},
  year   = {2018}
}

备注

6 pages