中文

一种匹配阿拉伯姓名的混合算法

计算与语言 2013-09-24 v1

摘要

本文提出了一种新的混合算法,结合了基于词元(token-based)和基于字符(character-based)的方法。基本的 Levenshtein 方法被扩展为基于词元的距离度量。该距离度量经过增强,以设定算法适当的粒度级别行为。它平滑地映射了字符级别的拼写错误差异阈值,以及词元级别错误在词元位置和频率方面的重要性。利用大型阿拉伯语数据集进行的实验结果表明,所提出的算法成功克服了许多类型的错误,例如:印刷错误、中间名成分的遗漏或插入、非显著常用名成分的遗漏,以及不同书写风格的字符变体。当使用相同数据集与其他经典算法进行比较时,发现所提出的算法提高了最佳测试算法的最小成功率水平,同时实现了更高的上限。

关键词

引用

@article{arxiv.1309.5657,
  title  = {A Hybrid Algorithm for Matching Arabic Names},
  author = {T. El-Shishtawy},
  journal= {arXiv preprint arXiv:1309.5657},
  year   = {2013}
}