基于词嵌入的作者检测模型对保语义对抗扰动的敏感性
计算与语言
2021-02-25 v1 人工智能
摘要
作者分析是自然语言处理领域的一个重要课题。它使得检测文章、新闻、书籍或消息最可能的写作者成为可能。该技术在作者归属、剽窃检测、风格分析、虚假信息来源等任务中有多种用途。本文的重点是探索已有方法对输入对抗性操控的局限性与敏感性。为此,利用这些已有技术,我们首先开发了一个用于作者检测与输入扰动的实验框架。接着,我们通过实验评估了作者检测模型对输入叙事的保语义对抗扰动集合的性能。最后,我们比较并分析了不同扰动策略、输入与模型配置的影响,以及这些对作者检测模型的作用。
引用
@article{arxiv.2102.11917,
title = {The Sensitivity of Word Embeddings-based Author Detection Models to Semantic-preserving Adversarial Perturbations},
author = {Jeremiah Duncan and Fabian Fallas and Chris Gropp and Emily Herron and Maria Mahbub and Paula Olaya and Eduardo Ponce and Tabitha K. Samuel and Daniel Schultz and Sudarshan Srinivasan and Maofeng Tang and Viktor Zenkov and Quan Zhou and Edmon Begoli},
journal= {arXiv preprint arXiv:2102.11917},
year = {2021}
}