中文

一种用于大规模文本归一化的快速随机算法

人工智能 2022-11-01 v1 信息检索

摘要

自然语言处理与数据挖掘中许多流行的机器学习技术严重依赖高质量文本来源。然而真实世界文本数据集包含大量拼写错误与标点不当的变体,会使这些模型性能迅速恶化。此外,真实世界的网页规模数据集包含数亿乃至数十亿行文本,现有文本清洗工具在其上执行代价过高,且可能需要额外开销来学习修正。本文提出 FLAN,一种可扩展的随机算法,用于清洗和规范化大规模文本数据。我们的算法依靠词间 Jaccard 相似度来给出修正结果。我们通过局部敏感哈希(LSH)高效处理词对词比较。我们还提出一种新颖的稳定化过程,以解决不相似词之间的哈希冲突问题,这是 LSH 随机性的后果,并因真实世界数据集的大规模而加剧。与现有方法相比,我们的方法在渐近意义和实证评估上均更高效,且不依赖额外特征(如词法/语音相似度或词嵌入特征)。此外,FLAN 不需要任何标注数据或有监督学习。我们进一步从理论上证明了算法的鲁棒性,给出了修正假阳性率与假阴性率的上界。我们在真实世界数据集上的实验结果展示了 FLAN 的效率与有效性。

关键词

引用

@article{arxiv.2110.03024,
  title  = {A Fast Randomized Algorithm for Massive Text Normalization},
  author = {Nan Jiang and Chen Luo and Vihan Lakshman and Yesh Dattatreya and Yexiang Xue},
  journal= {arXiv preprint arXiv:2110.03024},
  year   = {2022}
}

备注

10 pages