最长公共子序列的大规模模拟:有限尺度缩放、腔解与配置空间性质
无序系统与神经网络
2009-10-31 v1 统计力学
摘要
最长公共子序列(LCS)问题要求在两个给定字符序列中找到最长的(非连续)匹配子序列。通过大规模蒙特卡罗模拟,我们发现 LCS 长度的均值随字符串大小 的缩放律形式为 ,其中 为字母表大小。我们给出了 在 取 2 到 15 之间的数值估计。我们还考虑了一个相关的伯努利匹配模型,其中 数组的不同条目以概率 独立占据。在这种情况下,我们发现 的极限作为 无限大时,以 为变量的函数形式。该表达式为随机字符串模型提供了非常好的近似,随着 的增大,精度日益提升。还讨论了 LCS 问题“普适类”的问题。对于伯努利匹配模型,我们发现其与 Hwa 和 Lassig 针对 Needleman-Wunsch 序列比对的最新缩放预测一致。然而我们发现 LCS 长度的方差在随机字符串模型中具有不同的缩放,表明匹配之间的长程关联在该模型中是相关的。我们最终研究了该问题的“基态”性质。特别是我们发现解的数量通常随 的指数增长,即该系统在 时具有残余熵。另外,我们发现两个随机选择的 LCS 之间的重叠是自平均的,并且随 的增大趋于一个确定值 。
引用
@article{arxiv.cond-mat/9809280,
title = {Extensive Simulations for Longest Common Subsequences: Finite Size Scaling, a Cavity Solution, and Configuration Space properties},
author = {J. Boutet de Monvel},
journal= {arXiv preprint arXiv:cond-mat/9809280},
year = {2009}
}
备注
17 pages, 12 figures. Accepted for publication in EPJ B