爱沙尼亚语文本自动校正:EKTB25 项目最终报告
计算与语言
2024-02-20 v1 人工智能
摘要
该项目由爱沙尼亚语言技术国家计划于 2021-2023 年资助。其主要目标是为爱沙尼亚语开发拼写和语法校正工具。主要挑战是此类开发所需的可用纠错数据量非常少。为了缓解这一问题,(1) 我们标注了更多用于模型训练和测试的纠错数据,(2) 我们测试了迁移学习,即重新训练为其他任务创建的机器学习模型,以便不完全依赖纠错数据,(3) 我们将开发的方法和模型与替代方案(包括大型语言模型)进行了比较。我们还开发了自动评估系统,可以按错误类别计算校正的准确率和产出率,从而能够详细比较不同方法的有效性。在项目期间,大型语言模型取得了突破:支持爱沙尼亚语的商业语言模型 GPT4 已经问世。我们在调整计划时考虑到了该模型的存在,并在报告中展示了与 GPT4 改进爱沙尼亚语文本能力的比较。最终结果表明,我们开发的方法提供了比 GPT4 更好的分数,结果可用但尚未完全可靠。报告还包含关于未来如何实施 GPT4 和其他主要语言模型的想法,重点关注开源解决方案。该项目的所有结果均为开放数据/开源,其许可证允许将其用于包括商业用途在内的各种目的。
引用
@article{arxiv.2402.11671,
title = {Autocorrect for Estonian texts: final report from project EKTB25},
author = {Agnes Luhtaru and Martin Vainikko and Krista Liin and Kais Allkivi-Metsoja and Jaagup Kippar and Pille Eslon and Mark Fishel},
journal= {arXiv preprint arXiv:2402.11671},
year = {2024}
}
备注
in Estonian language