中文

大字母表序列的枚举

数据结构与算法 2012-11-14 v1 离散数学 信息论 math.IT

摘要

本研究主要借鉴 "Oktem & Astola 的层次枚举编码和 Schalkwijk 关于二元序列的渐近最优组合码的思想,专注于 σ\sigma 元序列枚举编码的高效方案。通过观察到内和为 nn 的不同 σ\sigma 维向量的数量(其中每个维度的值在 [0...n][0...n] 范围内)为 K(σ,n)=i=0σ1(n1σ1i)(σi)K(\sigma,n) = \sum_{i=0}^{\sigma-1} {{n-1} \choose {\sigma-1-i}} {{\sigma} \choose {i}},我们提出了通过枚举表示 CC 向量的方法,并给出了执行此任务的必要算法。我们证明了对于较大的 nnlogK(σ,n)\log K(\sigma,n) 所需的比特数比朴素的 (σ1)log(n+1)(\sigma-1)\lceil \log (n+1) \rceil 表示少约 (σ1)log(σ1)(\sigma -1) \log (\sigma-1) 个,并在实验上检验了不同字母表大小的结果。我们通过引入一种针对大字母表的新方法,扩展了 σ\sigma 元序列枚举编码的基本方案。我们在 DNA 序列上的实验表明,新引入的技术优于基本方案。

关键词

引用

@article{arxiv.1211.2926,
  title  = {Enumeration of sequences with large alphabets},
  author = {M. Oguzhan Kulekci},
  journal= {arXiv preprint arXiv:1211.2926},
  year   = {2012}
}