语言频率与阿克斯班错别纠正分析
计算与语言
2024-02-19 v2
摘要
当前的语法错别纠正 (GEC) 项目往往聚焦于主要语言,对于低资源语言如阿克斯班 (Esperanto) 的关注相对不足。本文首先通过使用专为此目的创建的 Eo-GP 数据集,进行全面的频率分析。随后,我们引入了 Eo-GEC 数据集,该数据集源自真实用户案例,并带有细粒度的语言细节,用于错误识别。借助 GPT-3.5 和 GPT-4,我们的实验表明 GPT-4 在自动化和人类评估方面均优于 GPT-3.5,突显了其在处理阿克斯班语法特殊性方面的效能,并揭示了先进语言模型在提升不常见语言 GEC 策略方面的潜力。
引用
@article{arxiv.2402.09696,
title = {An Analysis of Language Frequency and Error Correction for Esperanto},
author = {Junhong Liang},
journal= {arXiv preprint arXiv:2402.09696},
year = {2024}
}