中文

利用新型拼写校正系统提升波斯语临床文本质量

计算与语言 2024-08-08 v1 人工智能

摘要

背景:电子健康记录(EHR)中拼写的准确性对高效临床护理、研究和确保患者安全至关重要。波斯语拥有丰富的词汇和复杂的特性,为真实词错误校正带来了独特的挑战。本研究旨在开发一种创新方法,用于检测和校正波斯语临床文本中的拼写错误。方法:我们的策略采用最先进的预训练模型,该模型经过精心微调,专门针对波斯语临床领域的拼写校正任务。该模型由一种创新的正字法相似性匹配算法PERTO补充,该算法利用字符的视觉相似性对校正候选进行排序。结果:我们的方法评估展示了其在检测和纠正波斯语临床文本中词错误方面的鲁棒性和精确性。在非词错误校正方面,当使用PERTO算法时,模型实现了90.0%的F1分数。对于真实词检测,模型展示了最高性能,实现了90.6%的F1分数。此外,当使用PERTO算法时,模型在真实词错误校正方面达到了最高的91.5%的F1分数。结论:尽管存在某些局限性,我们的方法代表了波斯语临床文本拼写错误检测与校正领域的重大进展。通过有效应对波斯语带来的独特挑战,我们的方法为更准确、更高效的临床记录铺平了道路,有助于改善患者护理和安全。未来研究可探索其在波斯语医学领域其他方面的应用,增强其影响和效用。

关键词

引用

@article{arxiv.2408.03622,
  title  = {Improving the quality of Persian clinical text with a novel spelling correction system},
  author = {Seyed Mohammad Sadegh Dashti and Seyedeh Fatemeh Dashti},
  journal= {arXiv preprint arXiv:2408.03622},
  year   = {2024}
}