中文

PETGEN:面向基于深度序列嵌入分类模型的个性化文本生成攻击

机器学习 2021-10-20 v2 社会与信息网络

摘要

恶意用户接下来应写什么才能欺骗检测模型?识别恶意用户对于保障互联网平台的安全与完整性至关重要。已有若干基于深度学习的检测模型被提出。然而,恶意用户可通过操纵其行为来规避深度检测模型,使这些模型形同虚设。此类深度检测模型面对对抗攻击的脆弱性尚属未知。本文针对基于深度用户序列嵌入的分类模型(其利用用户帖子序列生成用户嵌入并检测恶意用户)创建了一种新颖的对抗攻击模型。在攻击中, adversary 生成一篇新帖子以欺骗分类器。我们提出一种新颖的端到端个性化文本生成攻击模型,称为 PETGEN,其同时降低检测模型的功效并生成具备若干关键理想属性的帖子。具体而言,PETGEN 生成的帖子个性化贴合用户写作风格、具备给定目标上下文的知识、知晓用户在该目标上下文上的历史帖子,并囊括用户近期的主题兴趣。我们在两个真实数据集(Yelp 与 Wikipedia,均含恶意用户真值)上开展大量实验,表明 PETGEN 显著降低了流行的基于深度用户序列嵌入的分类模型的性能。在白盒与黑盒分类器设置下,PETGEN 在文本质量与攻击功效方面均优于五种攻击基线。总体而言,本工作为下一代感知 adversary 的序列分类模型铺平了道路。

关键词

引用

@article{arxiv.2109.06777,
  title  = {PETGEN: Personalized Text Generation Attack on Deep Sequence Embedding-based Classification Models},
  author = {Bing He and Mustaque Ahamad and Srijan Kumar},
  journal= {arXiv preprint arXiv:2109.06777},
  year   = {2021}
}

备注

Accepted for publication at: 2021 ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'2021). Code and data at: https://github.com/srijankr/petgen