中文

生成标签凝聚且形式良好的对抗性声明

计算与语言 2020-09-18 v1 机器学习

摘要

对抗攻击揭示了训练模型的重要漏洞与缺陷。一种有效的攻击类型是基于通用对抗触发词,即个别n-gram,当附加到受攻击类别的实例后,可诱使模型预测目标类别。然而,对于事实核查等推理任务,这些触发词常会无意中反转其所插入实例的含义。此外,此类攻击通过简单将触发词拼接到现有样本上,产生语义无意义的输入。在此,我们研究如何对事实核查系统生成保留真实含义且语义有效的对抗攻击。我们扩展了用于通用触发词生成的HotFlip攻击算法,通过联合最小化事实核查模型的目标类别损失与辅助自然语言推理模型的蕴含类别损失。随后我们训练一个条件语言模型,以生成包含所发现通用触发词的语义有效陈述。我们发现,相较于先前工作,所生成的攻击更好地保持了声明的指向性与语义有效性。

关键词

引用

@article{arxiv.2009.08205,
  title  = {Generating Label Cohesive and Well-Formed Adversarial Claims},
  author = {Pepa Atanasova and Dustin Wright and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2009.08205},
  year   = {2020}
}

备注

9 pages, 1 figure, 4 tables