中文

探索 Grover 上的语义扰动

机器学习 2024-07-26 v2 计算与语言 计算机视觉与模式识别

摘要

随着新闻和信息如今变得极易获取,确保人们不被所读内容误导比以往任何时候都更为重要。近来,神经假新闻(AI 生成的假新闻)的兴起及其在欺骗人类方面所展现出的有效性,促使了用于检测此类新闻的模型的发展。Grover 模型便是其中之一,它既能检测神经假新闻以加以防范,也能生成假新闻以展示模型如何被滥用来欺骗人类读者。在本工作中,我们通过对输入新闻文章进行扰动实施针对性攻击,来探究 Grover 模型的假新闻检测能力。借此,我们测试了 Grover 对这些对抗性攻击的鲁棒性,并暴露出一些潜在的漏洞,这些漏洞应在后续迭代中加以解决,以确保其能准确检测各类假新闻。

关键词

引用

@article{arxiv.2302.00509,
  title  = {Exploring Semantic Perturbations on Grover},
  author = {Ziqing Ji and Pranav Kulkarni and Marko Neskovic and Kevin Nolan and Yan Xu},
  journal= {arXiv preprint arXiv:2302.00509},
  year   = {2024}
}