中文

基于自校正对抗训练的中文不自然文本纠错

计算与语言 2024-12-24 v1

摘要

不自然文本纠错旨在自动检测和纠正句子中的拼写错误或对抗扰动错误。现有方法通常依赖微调或对抗训练来纠正错误,已取得显著成功。然而,这些方法因训练数据分布与现实场景差异,表现出较差的泛化性能,称为暴露偏差问题。在本文中,我们提出一种用于学习错误的自校正对抗训练框架,即LIMIT(Learning from Mistakes: Self-correct Adversarial Training for Chinese Unnatural Text Correction),这是一种任务和模型无关的纠错框架。具体而言,我们充分利用在推理阶段主动暴露的模型生成的错误,即与目标不一致的预测。这种训练方法不仅模拟了潜在的现实应用场景,还减轻了传统训练过程的暴露偏差。同时,我们设计了一种新颖的解码干预策略以维持语义一致性。大量实验结果表明,我们提出的方法能够纠正多种形式的错误,并优于最新的文本纠错方法。在此基础上,针对中文和英文数据集的广泛结果表明,LIMIT可作为即插即用的防御模块,并可扩展到新的模型和数据集而无需进一步训练。

关键词

引用

@article{arxiv.2412.17279,
  title  = {Learning from Mistakes: Self-correct Adversarial Training for Chinese Unnatural Text Correction},
  author = {Xuan Feng and Tianlong Gu and Xiaoli Liu and Liang Chang},
  journal= {arXiv preprint arXiv:2412.17279},
  year   = {2024}
}

备注

AAAI 2025