中文

利用神经语言模型生成保留情感的伪造在线评论及其基于人类与机器的检测

计算与语言 2019-12-04 v2 密码学与安全 信息检索 机器学习

摘要

先进的神经语言模型 (NLMs) 因能够生成流畅且有意义的句子而被广泛用于序列生成任务。它们也可用于生成伪造评论,进而可用于攻击在线评论系统并影响在线购物者的购买决策。要实施此类攻击,专家需针对特定主题训练定制化的语言模型。本工作中,我们展示仅通过组合公开可用的 LM 即可构建低技能威胁模型,并表明所生成的伪造评论能够欺骗人类与机器。具体而言,我们使用 GPT-2 NLM 基于一条具有期望情感的评论生成大量高质量评论,随后使用基于 BERT 的文本分类器(准确率 96%)过滤掉具有非期望情感的评论。由于评论中无任何词语被修改,可从学到的分布中生成如同训练数据般流畅的样本。一项有 80 名参与者的主观评估表明,这一简单方法能生成与人类所写一样流畅的评论。评估还显示参与者倾向于随机区分伪造评论。三种对策——Grover、GLTR 和 OpenAI GPT-2 detector——被发现难以准确检测伪造评论。

关键词

引用

@article{arxiv.1907.09177,
  title  = {Generating Sentiment-Preserving Fake Online Reviews Using Neural Language Models and Their Human- and Machine-based Detection},
  author = {David Ifeoluwa Adelani and Haotian Mai and Fuming Fang and Huy H. Nguyen and Junichi Yamagishi and Isao Echizen},
  journal= {arXiv preprint arXiv:1907.09177},
  year   = {2019}
}

备注

The 34-th International Conference on Advanced Information Networking and Applications (AINA-2020)