中文

爱沙尼亚语文本自动校正:EKTB25 项目最终报告

计算与语言 2024-02-20 v1 人工智能

摘要

该项目由爱沙尼亚语言技术国家计划于 2021-2023 年资助。其主要目标是为爱沙尼亚语开发拼写和语法校正工具。主要挑战是此类开发所需的可用纠错数据量非常少。为了缓解这一问题,(1) 我们标注了更多用于模型训练和测试的纠错数据,(2) 我们测试了迁移学习,即重新训练为其他任务创建的机器学习模型,以便不完全依赖纠错数据,(3) 我们将开发的方法和模型与替代方案(包括大型语言模型)进行了比较。我们还开发了自动评估系统,可以按错误类别计算校正的准确率和产出率,从而能够详细比较不同方法的有效性。在项目期间,大型语言模型取得了突破:支持爱沙尼亚语的商业语言模型 GPT4 已经问世。我们在调整计划时考虑到了该模型的存在,并在报告中展示了与 GPT4 改进爱沙尼亚语文本能力的比较。最终结果表明,我们开发的方法提供了比 GPT4 更好的分数,结果可用但尚未完全可靠。报告还包含关于未来如何实施 GPT4 和其他主要语言模型的想法,重点关注开源解决方案。该项目的所有结果均为开放数据/开源,其许可证允许将其用于包括商业用途在内的各种目的。

关键词

引用

@article{arxiv.2402.11671,
  title  = {Autocorrect for Estonian texts: final report from project EKTB25},
  author = {Agnes Luhtaru and Martin Vainikko and Krista Liin and Kais Allkivi-Metsoja and Jaagup Kippar and Pille Eslon and Mark Fishel},
  journal= {arXiv preprint arXiv:2402.11671},
  year   = {2024}
}

备注

in Estonian language