面向中文语法纠错的首尾非自回归序列预测
计算与语言
2021-10-27 v3 人工智能
摘要
我们研究中文语法纠错(CGEC)问题,并提出一种名为首尾(\textbf{TtT})非自回归序列预测的新框架,以解决 CGEC 中隐藏的深层次问题。考虑到大多数词元是正确的且可直接从源端传送到目标端,且错误位置可基于双向上下文信息进行估计和纠正,因此我们采用以 BERT 初始化的 Transformer Encoder 作为骨干模型来进行信息建模与传送。考虑到仅依赖同位置替换无法处理变长纠正情况,需要联合使用替换、删除、插入和局部改写等多种操作。因此,在上端尾部堆叠一个条件随机场(CRF)层,通过对词元依赖关系建模来进行非自回归序列预测。由于大多数词元是正确的且易于被预测/传送到目标端,模型可能遭受严重的类别不平衡问题。为缓解该问题,将 focal loss 惩罚策略整合进损失函数中。此外,除典型的定长纠错数据集外,我们还构建了一个变长语料库进行实验。在标准数据集上的实验结果,尤其在变长数据集上,证明了 TtT 在错误检测与纠正任务的句子级准确率、精确率、召回率和 F1 值方面的有效性。
引用
@article{arxiv.2106.01609,
title = {Tail-to-Tail Non-Autoregressive Sequence Prediction for Chinese Grammatical Error Correction},
author = {Piji Li and Shuming Shi},
journal= {arXiv preprint arXiv:2106.01609},
year = {2021}
}
备注
ACL 2021. Code: https://github.com/lipiji/TtT. Fix the results of SpellGCN on Oct.26,2021