中文

针对文本体裁的对抗攻击实验

计算与语言 2021-07-07 v1

摘要

基于预训练 transformer(如 BERT 或 XLM-RoBERTa)的神经模型在许多 NLP 任务中展示了 SOTA 结果,包括非主题分类,如体裁识别。然而,这些方法常对测试文本的微小改动表现出低可靠性。一个相关问题涉及训练语料中的主题偏差,例如特定体裁中某特定主题词的盛行可能误导体裁分类器将该主题下任何文本识别为该体裁。为缓解可靠性问题,本文研究攻击体裁分类器的技术,以理解 transformer 模型的局限并改进其性能。虽然简单文本攻击(如基于使用 tf-idf 提取关键词的词语替换)无法欺骗 XLM-RoBERTa 等强大模型,我们表明基于嵌入的算法可将一些最“显著”的词替换为相似词(例如 TextFooler),能够在相当比例的案例中影响模型预测。

关键词

引用

@article{arxiv.2107.02246,
  title  = {Experiments with adversarial attacks on text genres},
  author = {Mikhail Lepekhin and Serge Sharoff},
  journal= {arXiv preprint arXiv:2107.02246},
  year   = {2021}
}