中文

用于纯文本表格检测的忽略想象尾部空白的莱文斯坦距离

数据结构与算法 2021-03-15 v1 计算与语言 信息检索

摘要

标准的莱文斯坦距离算法将尾部空白视为与其他字母或符号相同。然而,当人类比较两条字符串时,我们隐式地假设两条字符串都由无限尾部空白填充。这影响了我们对插入、删除与替换代价应有的预期。这种对我们预期的违背导致了不直观的编辑距离值。为考虑这一特定人类直觉,一种考量“所有可能”尾部空白子串的朴素方法将产生 O(n3)O(n^3) 算法。在本工作中,我们提供了一种高效的 O(n2)O(n^2) 算法来计算相同结果。关键词:想象无限尾部空白、人类友好、直观编辑距离、表格检测、表格对齐

关键词

引用

@article{arxiv.2103.06942,
  title  = {Imagined-Trailing-Whitespace-Agnostic Levenshtein Distance For Plaintext Table Detection},
  author = {Kartik Vempala},
  journal= {arXiv preprint arXiv:2103.06942},
  year   = {2021}
}