中文

语言频率与阿克斯班错别纠正分析

计算与语言 2024-02-19 v2

摘要

当前的语法错别纠正 (GEC) 项目往往聚焦于主要语言,对于低资源语言如阿克斯班 (Esperanto) 的关注相对不足。本文首先通过使用专为此目的创建的 Eo-GP 数据集,进行全面的频率分析。随后,我们引入了 Eo-GEC 数据集,该数据集源自真实用户案例,并带有细粒度的语言细节,用于错误识别。借助 GPT-3.5 和 GPT-4,我们的实验表明 GPT-4 在自动化和人类评估方面均优于 GPT-3.5,突显了其在处理阿克斯班语法特殊性方面的效能,并揭示了先进语言模型在提升不常见语言 GEC 策略方面的潜力。

关键词

引用

@article{arxiv.2402.09696,
  title  = {An Analysis of Language Frequency and Error Correction for Esperanto},
  author = {Junhong Liang},
  journal= {arXiv preprint arXiv:2402.09696},
  year   = {2024}
}