DPCSpell:基于Transformer的检测-净化-纠正框架用于孟加拉语及资源稀缺印度语言的拼写纠错
计算与语言
2024-12-03 v3
摘要
拼写纠错是识别并修正文本中错拼词的任务。由于在人类语言理解中的众多应用,它是自然语言处理中一个具有潜力且活跃的研究课题。语音或视觉相似但语义不同的字符使得该任务在任何语言中都颇为艰巨。先前针对孟加拉语及资源稀缺印度语言的拼写纠错工作集中于基于规则、统计和机器学习的方法,我们发现它们效率低下。特别是,表现出优于基于规则和统计方法性能的机器学习方法,因不论字符是否恰当均逐一纠正而无效。本文中,我们通过解决先前问题,提出了一种基于去噪Transformer的新颖检测-净化-纠正框架DPCSpell。此外,我们提出了一种从零开始大规模语料创建的方法,这进而解决了任何从左向右书写语言的资源限制问题。实证结果展示了我们方法的有效性,在孟加拉语拼写纠错上以精确匹配(EM)得分94.78%、精确率0.9487、召回率0.9478、f1得分0.948、f0.5得分0.9483及修正准确率(MA)95.16%优于先前最先进方法。模型与语料已公开于 https://tinyurl.com/DPCSpell。
引用
@article{arxiv.2211.03730,
title = {DPCSpell: A Transformer-based Detector-Purificator-Corrector Framework for Spelling Error Correction of Bangla and Resource Scarce Indic Languages},
author = {Mehedi Hasan Bijoy and Nahid Hossain and Salekul Islam and Swakkhar Shatabda},
journal= {arXiv preprint arXiv:2211.03730},
year = {2024}
}
备注
29 pages, 4 figures, and 9 tables