中文

用于符号序列可微比较的软编辑距离

机器学习 2019-04-30 v1 机器学习

摘要

编辑距离,又称 Levenshtein 距离,是比较两个字符串的基本方法,在基因序列分析和自然语言处理中尤为有用。然而,编辑距离是一个离散函数,已知难以优化。这一事实阻碍了该度量在机器学习中的使用。即便是如 K-means 这样简单的算法,在序列长度可变且数量众多时,也无法使用编辑距离对一组序列进行聚类。本文提出一种新颖的度量——软编辑距离(SED),它是编辑距离的平滑近似。该度量可微,因此可以用梯度方法进行优化。与原始编辑距离类似,SED 及其导数均可通过递推公式在多项式时间内计算。我们在合成数据集和生物序列聚类的实验中证明了所提度量的有效性。

关键词

引用

@article{arxiv.1904.12562,
  title  = {Soft edit distance for differentiable comparison of symbolic sequences},
  author = {Evgenii Ofitserov and Vasily Tsvetkov and Vadim Nazarov},
  journal= {arXiv preprint arXiv:1904.12562},
  year   = {2019}
}