中文

对抗性文本归一化

计算与语言 2022-06-10 v1

摘要

基于文本的对抗攻击正变得愈发普遍,且普通互联网用户也可轻易实施。随着这些攻击的扩散,弥补模型鲁棒性缺口的需求变得迫在眉睫。虽然在对抗数据上重新训练可能提升性能,但仍存在一类字符级攻击会使这些模型失灵。此外,重新训练模型的过程耗时耗资源,因而亟需一种轻量、可复用的防御手段。本工作中,我们提出对抗性文本归一化器(Adversarial Text Normalizer),一种以低计算开销在被攻击内容上恢复基线性能的新方法。我们在易受对抗攻击的两个问题领域(即仇恨言论与自然语言推理)上评估了该归一化器的效能。我们发现文本归一化提供了一种针对字符级攻击的任务无关防御,可作为对抗重训练方案(更适用于语义改动)的补充。

关键词

引用

@article{arxiv.2206.04137,
  title  = {Adversarial Text Normalization},
  author = {Joanna Bitton and Maya Pavlova and Ivan Evtimov},
  journal= {arXiv preprint arXiv:2206.04137},
  year   = {2022}
}