中文

存在插入与删除情况下的高效平均情形种群恢复

数据结构与算法 2019-07-16 v1 信息论 机器学习 math.IT

摘要

最近的几项工作考虑了迹重构问题,其中未知源字符串 x{0,1}nx\in\{0,1\}^n 通过一个可能随机删除坐标或插入随机比特的概率信道传输,从而产生 xx 的一个迹。目标是从 xx 的独立迹中重构原始字符串 xx。虽然针对最坏情形字符串的已知最佳算法使用 exp(O(n1/3))\exp(O(n^{1/3})) 条迹 \cite{DOS17,NazarovPeres17},但对于 xx 均匀随机的平均情形版本,已知存在高效的算法 \cite{PZ17,HPP18}。我们考虑该平均情形迹重构问题的一个推广,我们称之为存在插入与删除情况下的平均情形种群恢复。在此问题中,存在一个关于 ss 个未知源字符串 x1,,xs{0,1}nx^1,\dots,x^s \in \{0,1\}^n 的未知分布 D\cal{D},每个样本通过从 D\cal{D} 中抽取某个 xix^i 并返回 xix^i 的一个独立迹独立生成。基于 \cite{PZ17} 和 \cite{HPP18},我们为该问题提供了一种高效算法。对于任意支持集大小 sexp(Θ(n1/3))s \leq \smash{\exp(\Theta(n^{1/3}))},对于所有 ss 元素支持集 {x1,,xs}{0,1}n\{x^1,\dots,x^s\} \subset \{0,1\}^n 中的 1o(1)1-o(1) 比例,对于每个以 {x1,,xs}\{x^1,\dots,x^s\} 为支持的分布 D\cal{D},在给定对来自 D\cal{D} 的独立抽取的独立迹的访问权限下,我们的算法能以高概率高效地恢复 D{\cal D} 至全变差距离 ϵ\epsilon 以内。该算法运行时间为 poly(n,s,1/ϵ)(n,s,1/\epsilon),其样本复杂度为 poly(s,1/ϵ,exp(log1/3n))(s,1/\epsilon,\exp(\log^{1/3}n))。这种对支持集大小 ss 的多项式依赖与最坏情形版本(当 x1,,xsx^1,\dots,x^s 可以是 {0,1}n\{0,1\}^n 中的任意字符串时)形成鲜明对比,在最坏情形中,已知最高效算法 \cite{BCFSS19} 的样本复杂度在 ss 上呈双重指数级。

关键词

引用

@article{arxiv.1907.05964,
  title  = {Efficient average-case population recovery in the presence of insertions and deletions},
  author = {Frank Ban and Xi Chen and Rocco A. Servedio and Sandip Sinha},
  journal= {arXiv preprint arXiv:1907.05964},
  year   = {2019}
}