MALCOM:生成恶意评论以攻击神经假新闻检测模型
计算与语言
2020-09-29 v2 机器学习
机器学习
摘要
近年来,所谓“假新闻”的泛滥对社会造成了诸多破坏,并削弱了新闻生态系统。因此,为缓解此类问题,研究者已开发出最先进的模型,利用复杂的数据科学与机器学习技术自动检测社交媒体上的假新闻。那么,在本文中我们追问“若对手试图攻击此类检测模型会怎样?”,并通过以下方式探讨相关问题:(i) 提出一种针对假新闻检测器的新型威胁模型,其中对手可对新闻文章发布恶意评论以误导假新闻检测器;(ii) 开发 MALCOM,一个端到端的对抗性评论生成框架以实现此类攻击。通过综合评估,我们证明 MALCOM 平均约 94% 和 93.5% 的时间能成功误导五个最新神经检测模型始终输出目标真实与虚假新闻标签。此外,MALCOM 还能欺骗黑盒假新闻检测器,使其平均 90% 的时间始终输出真实新闻标签。我们还将我们的攻击模型与四个基线在两个真实世界数据集上进行比较,不仅比较攻击性能,还比较生成质量、连贯性、可迁移性与鲁棒性。
引用
@article{arxiv.2009.01048,
title = {MALCOM: Generating Malicious Comments to Attack Neural Fake News Detection Models},
author = {Thai Le and Suhang Wang and Dongwon Lee},
journal= {arXiv preprint arXiv:2009.01048},
year = {2020}
}
备注
Accepted at the 20th IEEE International Conference on Data Mining (ICDM 2020)