Lexis:一种用于发现序列数据层次结构的优化框架
人工智能
2016-06-14 v3 数据结构与算法
摘要
以字符串形式表示的数据广泛存在于生物学、语言学、文档挖掘、网络搜索等诸多领域。此类数据通常具有层次结构,这可能是因为其被人为以层次化方式设计并组合,或者因为存在潜在的进化过程,从较简单的子串反复创建出更复杂的字符串。我们提出一个名为“Lexis”的框架,该框架为给定的一组“目标”字符串生成优化的层次化表示。所得层次结构“Lexis-DAG”展示了如何通过中间子串的拼接来构造每个目标,并使此类拼接或DAG边的总数最小化。Lexis优化问题与最小文法问题相关。在我们证明其对于两种代价公式的NP难性质后,我们提出了一种用于构建Lexis-DAG的高效贪心算法。我们还考虑了识别中间节点(子串)集合的问题,这些节点共同构成Lexis-DAG的“核心”,这在Lexis-DAG的分析中十分重要。我们展示了Lexis框架可应用于多种场景,例如基因组文库中DNA片段的优化合成、蛋白质序列中的层次结构发现、基于词典的文本压缩,以及从文档集合中进行特征提取。
引用
@article{arxiv.1602.05561,
title = {Lexis: An Optimization Framework for Discovering the Hierarchical Structure of Sequential Data},
author = {Payam Siyari and Bistra Dilkina and Constantine Dovrolis},
journal= {arXiv preprint arXiv:1602.05561},
year = {2016}
}