人非圣贤孰能无过,羊驼亦可习之
计算与语言
2024-10-07 v2
摘要
本研究探讨了利用语言模型(LMs)进行人工错误生成(AEG)以增强语法错误纠正(GEC)的方法。具体而言,我们对基于 Llama 2 的语言模型进行微调以生成错误,发现该方法产生的合成错误与人类错误相似。随后,我们利用这些人工错误训练 GEC Llama 模型,其表现优于此前的最先进错误纠正模型,在所有测试语言(德语、乌克兰语和爱沙尼亚语)中 F0.5 分数提升了 0.8 至 6 分。此外,我们证明通过对较小的序列到序列模型进行微调以生成错误,并提示大型商业语言模型(GPT-3.5 和 GPT-4),也能产生对错误生成模型有益的合成错误。
引用
@article{arxiv.2403.05493,
title = {To Err Is Human, but Llamas Can Learn It Too},
author = {Agnes Luhtaru and Taido Purason and Martin Vainikko and Maksym Del and Mark Fishel},
journal= {arXiv preprint arXiv:2403.05493},
year = {2024}
}