GPT-3.5 与 GPT-4 在语法错误纠正中的性能分析
计算与语言
2023-05-31 v2
摘要
GPT-3 与 GPT-4 模型功能强大,在多种自然语言处理任务上取得了高性能。然而,关于它们在语法错误纠正(GEC)任务上性能的详细公开分析相对缺乏。为此,我们进行了实验,测试 GPT-3.5 模型(text-davinci-003)与 GPT-4 模型(gpt-4-0314)在主要 GEC 基准上的能力。我们比较了零样本与少样本设置下不同提示的性能,分析了不同提示格式下遇到的有趣或问题输出。我们报告了最佳提示在 BEA-2019 与 JFLEG 数据集上的性能,发现 GPT 模型在句子级修订设置中表现良好,其中 GPT-4 在 JFLEG 基准上取得了新的最高分。通过人工评估实验,我们将 GPT 模型的纠正结果与源句、人工参照句及基线 GEC 系统句子进行比较,观察到编辑策略的差异以及人工评分者对其的打分方式。
引用
@article{arxiv.2303.14342,
title = {Analyzing the Performance of GPT-3.5 and GPT-4 in Grammatical Error Correction},
author = {Steven Coyne and Keisuke Sakaguchi and Diana Galvan-Sosa and Michael Zock and Kentaro Inui},
journal= {arXiv preprint arXiv:2303.14342},
year = {2023}
}