中文

语法与拼写错误纠正:基于 BART 和 MarianMT 探究 Transformer 语言模型的纠正能力

计算与语言 2024-03-26 v1

摘要

文本持续作为信息的一种重要表示形式。文本文档要么在数字原生平台中创建,要么通过图像和语音等其他媒体文件的转换生成。数字原生文本无一例外地通过物理或虚拟键盘获取,而 OCR 和语音识别等技术则用于将图像和语音信号转换为文本内容。所有这些多样的文本生成机制也会在捕获的文本中引入错误。本项目旨在分析文本文档中出现的不同类型的错误。本工作采用两种先进的基于深度神经网络的语言模型,即 BART 和 MarianMT,来纠正文本中存在的异常。利用可用数据集对这些模型进行迁移学习,以微调其错误纠正能力。通过比较研究,考察了这些模型在处理每种定义的错误类别时的有效性。观察到,尽管两种模型均能将错误句子减少 20% 以上,但 BART 处理拼写错误的能力(24.6%)远优于处理语法错误的能力(8.8%)。

关键词

引用

@article{arxiv.2403.16655,
  title  = {Grammatical vs Spelling Error Correction: An Investigation into the Responsiveness of Transformer-based Language Models using BART and MarianMT},
  author = {Rohit Raju and Peeta Basa Pati and SA Gandheesh and Gayatri Sanjana Sannala and Suriya KS},
  journal= {arXiv preprint arXiv:2403.16655},
  year   = {2024}
}