ErAConD:面向语法错误纠正的带错误标注对话数据集
计算与语言
2025-08-27 v2
摘要
当前可用的语法错误纠正(GEC)数据集均使用结构良好的书面文本编译而成,限制了这些数据集在非正式写作与对话等其他领域的适用性。在本文中,我们呈现一个取自开放域聊天机器人对话的新型并行 GEC 数据集;据我们所知,该数据集是首个面向对话场景的 GEC 数据集。为证明该数据集的效用,我们使用标注数据微调了一个最先进的 GEC 模型,使模型精确率提升了 16 个点。这在 GEC 模型中尤为重要,因为模型精确率被认为比召回率更重要,由于假阳性可能导致语言学习者严重困惑。我们还提出了一个详细的标注方案,按对可理解性的感知影响对错误排序,使我们的数据集既可复现又可扩展。实验结果表明我们的数据在提升对话场景下 GEC 模型性能方面的有效性。
引用
@article{arxiv.2112.08466,
title = {ErAConD : Error Annotated Conversational Dialog Dataset for Grammatical Error Correction},
author = {Xun Yuan and Derek Pham and Sam Davidson and Zhou Yu},
journal= {arXiv preprint arXiv:2112.08466},
year = {2025}
}