中文

通过分析文本复杂性识别对抗性句子

计算与语言 2019-12-20 v1

摘要

攻击者制造对抗性文本以欺骗人类感知和当前 AI 系统,从而达到恶意目的,例如垃圾产品评论和虚假政治帖子。我们研究对抗性文本与原始文本之间的差异以防范该风险。我们证明人类书写的文本更具连贯性与流畅性。此外,人类能够通过使用现代词汇的灵活文本表达观点,而机器侧重于用简单常见词汇优化所生成文本。我们还提出了一种通过提取与我们的发现相关的特征来识别对抗性文本的方法。所提方法取得了 82.0% 准确率和 18.4% 等错误率的高性能,优于现有最佳准确率为 77.0%、对应错误率 22.8% 的方法。

关键词

引用

@article{arxiv.1912.08981,
  title  = {Identifying Adversarial Sentences by Analyzing Text Complexity},
  author = {Hoang-Quoc Nguyen-Son and Tran Phuong Thao and Seira Hidano and Shinsaku Kiyomoto},
  journal= {arXiv preprint arXiv:1912.08981},
  year   = {2019}
}

备注

PACLIC 2019, 9 pages