中文

数据驱动的对抗性文本扰动缓解

计算与语言 2022-02-22 v1 社会与信息网络

摘要

社交网络已成为我们生活中不可或缺的一部分,数十亿人产生着不断增长的文本量。在此规模下,内容政策及其执行变得至关重要。为实现审核自动化,可疑内容由自然语言处理(NLP)分类器检测。然而,高性能分类器受到拼写错误和对抗性文本扰动的阻碍。本文将有意和无意的对抗性文本扰动分为十类,并提出一个去混淆流水线以使 NLP 模型对此类扰动具有鲁棒性。我们提出连续 Word2Vec(CW2V),一种数据驱动方法,用于学习词嵌入,确保词的扰动形式具有与原始词相似的嵌入。我们表明 CW2V 嵌入通常比基于字符 n-gram 的嵌入对文本扰动更鲁棒。我们的鲁棒分类流水线结合了去混淆与分类,使用所提出的防御方法和词嵌入来对 Facebook 帖子是否请求如点赞等互动进行分类。我们的流水线在存在对抗性文本扰动时,互动诱饵分类的 AUC 从 0.70 降至 0.67,而基于字符 n-gram 的词嵌入方法导致的下游分类 AUC 从 0.76 降至 0.64。

关键词

引用

@article{arxiv.2202.09483,
  title  = {Data-Driven Mitigation of Adversarial Text Perturbation},
  author = {Rasika Bhalerao and Mohammad Al-Rubaie and Anand Bhaskar and Igor Markov},
  journal= {arXiv preprint arXiv:2202.09483},
  year   = {2022}
}