学习字符串编辑距离
cmp-lg
2008-02-03 v3 计算与语言
摘要
在许多应用中,需要确定两个字符串的相似度。广泛使用的字符串相似度概念是编辑距离:将一个字符串转换为另一个字符串所需的最少插入、删除和替换次数。在本报告中,我们提供了一个字符串编辑距离的随机模型。我们的随机模型使我们能够从示例语料库中学习字符串编辑距离函数。我们通过将该方法应用于会话语音中单词发音学习的难题来说明其效用。在该应用中,我们学习的字符串编辑距离的错误率仅为未经训练的 Levenshtein 距离的四分之一。我们的方法适用于任何可通过与标记原型数据库的相似度函数来解决的字符串分类问题。
引用
@article{arxiv.cmp-lg/9610005,
title = {Learning string edit distance},
author = {Eric Sven Ristad and Peter N. Yianilos},
journal= {arXiv preprint arXiv:cmp-lg/9610005},
year = {2008}
}
备注
http://www.cs.princeton.edu/~ristad/papers/pu-532-96.ps.gz