RoChBERT:面向中文鲁棒BERT微调的框架
计算与语言
2022-10-31 v1
摘要
尽管预训练语言模型(如BERT)在广泛任务上表现优异,但其已被证明易受对抗文本攻击。本文提出RoChBERT,一个通过利用更全面的对抗图,在微调阶段将中文音韵与字形特征融合进预训练表示,从而构建更鲁棒BERT基模型的框架。受课程学习启发,我们进一步提出用对抗文本结合中间样本来扩充训练数据集。大量实验表明RoChBERT以显著方式优于先前方法:(i)鲁棒——RoChBERT大幅提升模型鲁棒性且不牺牲良性文本上的准确率。具体而言,该防御将无限与有限攻击的成功率分别降低59.43%与39.33%,同时保持93.30%的准确率;(ii)灵活——RoChBERT可轻松扩展至各类语言模型以解决不同下游任务且性能优异;(iii)高效——RoChBERT可直接应用于微调阶段,无需从头预训练语言模型,且所提数据扩充方法成本低廉。
引用
@article{arxiv.2210.15944,
title = {RoChBert: Towards Robust BERT Fine-tuning for Chinese},
author = {Zihan Zhang and Jinfeng Li and Ning Shi and Bo Yuan and Xiangyu Liu and Rong Zhang and Hui Xue and Donghong Sun and Chao Zhang},
journal= {arXiv preprint arXiv:2210.15944},
year = {2022}
}
备注
Accepted by Findings of EMNLP 2022