基于星状PFA的字典树高度平滑分析
数据结构与算法
2020-03-10 v1 离散数学
摘要
字典树是用于信息检索的通用数据结构。字典树最重要的参数是其高度 ,等于构建该字典树的集合 中任意两个字符串最长公共前缀的长度。对随机字典树的分析研究表明 ,尽管在最坏情况下 无界。此外,针对许多不同随机字符串源, 分布函数的精确结果已知。但由于平均情况分析背后建模的固有弱点——分析被随机数据主导——这些结果无法完全解释在许多实际情形下字典树高度为对数的事实。我们提出一种新的半随机字符串模型并进行平滑分析,以对实际发现给出数学上更严谨的解释。我们所考虑的扰动函数基于概率有限自动机(PFA),并展示表示PFA的转移概率完全刻画了平滑字典树高度的渐近增长。我们的主要结果具有二分性质——对数或无界——初看固然不令人惊讶,但我们也给出了定量的上下界,其利用多元生成函数推导以表达扰动PFA的计算。一个直接推论是编辑扰动(即随机插入、删除和替换)下的对数字典树高度。
引用
@article{arxiv.2003.04101,
title = {Smoothed Analysis of Trie Height by Star-like PFAs},
author = {Stefan Eckhardt and Sven Kosub and Johannes Nowak},
journal= {arXiv preprint arXiv:2003.04101},
year = {2020}
}
备注
31 pages; slightly updated version of local technical report TUM-I0715, Institut f\"ur Informatik, Technische Universit\"at M\"unchen, July 2007