中文

打破方差:在$\tilde O(1/\epsilon)$时间内每比对近似计算汉明距离

数据结构与算法 2015-12-15 v1

摘要

计算给定长度mm的模式与长度nn的文本中每个位置的汉明距离,是字符串算法中最基本的算法任务之一。遗憾的是,有证据表明对于大小nn的文本TT和大小mm的模式PP,无法在小于O~(nm)\tilde O(n\sqrt m)的时间内计算TT中所有位置的精确汉明距离。然而,Karloff~\cite{karloff}表明,如果愿意接受1±ϵ1\pm\epsilon的近似,则有可能以高概率在O~(nϵ2)\tilde O(\frac n {\epsilon^2})时间内解决问题。由于在计算两个字符串汉明距离的单向通信复杂度模型中存在相关的下界,人们强烈认为作为1ϵ\frac 1 \epsilon的函数,求解近似版本的算法不可能快很多。我们在此表明这一信念是错误的,引入了一种新的O~(nϵ)\tilde O(\frac{n}{\epsilon})时间算法,它以高概率成功。我们算法背后的主要思想(在稀疏恢复问题中很常见)是通过(近似)将重命中项与非重命中项分离来减少特定随机实验的方差。然而,虽然已知的稀疏恢复技术对向量非常有效,但在我们处理字符对之间不匹配的情况下似乎不适用。我们引入了两个主要算法成分。第一个是适用于对输入(如我们的设置)的新稀疏恢复方法。第二个是哈希/投影函数的新构造,它允许以比暴力方法指数级更快的速度计算引起两个字符之间不匹配的投影数量。我们期望这些算法技术具有独立意义。

关键词

引用

@article{arxiv.1512.04515,
  title  = {Breaking the Variance: Approximating the Hamming Distance in $\tilde O(1/\epsilon)$ Time Per Alignment},
  author = {Tsvi Kopelowitz and Ely Porat},
  journal= {arXiv preprint arXiv:1512.04515},
  year   = {2015}
}

备注

Appeared in FOCS 2015