中文

超越困难样本:基于循环自增强的鲁棒且有效的语法错误纠正

计算与语言 2023-10-24 v2

摘要

近期研究表明,序列到序列范式下的语法错误纠正方法易受对抗攻击,而在预训练或后训练过程中简单利用对抗样本,可在干净数据上性能损失不大的情况下,显著增强 GEC 模型对特定类型攻击的鲁棒性。本文中,我们进一步对前沿 GEC 方法在四种不同对抗攻击下的鲁棒性进行了全面评估,并据此提出一种简单却非常有效的循环自增强(CSA)方法。通过在后训练过程中利用 GEC 模型自身的增强数据,并引入正则化数据用于循环训练,我们所提方法仅需以额外少数训练轮数为代价,即可有效提升训练良好 GEC 模型的鲁棒性。更具体地,在正则化数据上进一步训练可防止 GEC 模型在易学样本上过拟合,从而提升对未见数据(对抗噪声/样本)的泛化能力与鲁棒性。同时,自增强数据可提供更多高质量伪对齐对,以改善模型在原始测试数据上的表现。在四个基准数据集与七个强模型上的实验表明,我们提出的训练方法无需在训练中使用专门构建的对抗样本,即可显著增强对四类攻击的鲁棒性。在干净数据上的评估结果进一步证实,我们提出的 CSA 方法显著提升了四个基线的性能,并取得了与其他最先进(SOTA)模型近乎可比的结果。我们的代码可在 https://github.com/ZetangForward/CSA-GEC 获取。

关键词

引用

@article{arxiv.2310.13321,
  title  = {Beyond Hard Samples: Robust and Effective Grammatical Error Correction with Cycle Self-Augmenting},
  author = {Zecheng Tang and Kaifeng Qi and Juntao Li and Min Zhang},
  journal= {arXiv preprint arXiv:2310.13321},
  year   = {2023}
}