基于BERT和Levenshtein距离的拼写纠正综合方法
计算与语言
2024-07-25 v1 人工智能
机器学习
摘要
书写作为一种普遍存在的 human communication 形式,渗透于当代生活的几乎所有方面。因此,书写中的不准确或错误可能导致深远的后果, ranging from 金融损失到潜在的致命后果。拼写错误是最常见的书写错误,由于各种因素经常出现。本研究旨在使用神经网络识别和纠正文本中的各种拼写错误,具体利用双向编码器表示Transformer(BERT)掩码语言模型。为实现这一目标,我们构建了一个涵盖非真实单词和真实单词错误的综合数据集,并对不同类型的拼写错误进行了分类。随后,我们采用了多个预训练的BERT模型。为确保对拼写错误进行最佳纠正,我们提出了一种结合BERT掩码语言模型和Levenshtein距离的综合方法。我们的结果表明,本文所提出的系统在识别和纠正拼写错误方面具有显著的能力,常常优于现有的针对波斯语语言的系统。
关键词
引用
@article{arxiv.2407.17383,
title = {A Comprehensive Approach to Misspelling Correction with BERT and Levenshtein Distance},
author = {Amirreza Naziri and Hossein Zeinali},
journal= {arXiv preprint arXiv:2407.17383},
year = {2024}
}
备注
12 pages, 9 figures, 5 tables