中文

面向对抗性文本生成的可视化分析框架

人机交互 2020-12-21 v1 密码学与安全

摘要

本文提出一种框架,使用户能够更轻松地对对抗性文本进行修正。尽管已有攻击算法被证明可自动构造对抗样本,但算法所做的修改常存在语义或句法不佳的问题。我们的框架旨在通过辅助用户进行修正来促进人工干预。该框架扩展现有攻击算法,使其工作于进化攻击流程并与可视化分析环路相结合。利用交互式仪表盘,用户能够实时审视生成过程,并接收系统给出的编辑建议。所生成的对抗样本既可用于诊断单一分类器内的鲁棒性问题,也可用于比较多种分类器选项。在识别弱点后,该框架还可作为缓解对抗威胁的第一步。该框架可作为进一步防御方法研究的一部分,其中对抗样本被用于评估新对策。我们以情感分类任务中的词语替换攻击演示了该框架。

关键词

引用

@article{arxiv.1909.11202,
  title  = {A Visual Analytics Framework for Adversarial Text Generation},
  author = {Brandon Laughlin and Christopher Collins and Karthik Sankaranarayanan and Khalil El-Khatib},
  journal= {arXiv preprint arXiv:1909.11202},
  year   = {2020}
}