面向文本的可解释对抗训练
机器学习
2019-05-31 v1 计算与语言
机器学习
摘要
在文本领域生成高质量且可解释的对抗样本,是一项比图像领域艰巨得多的任务。这部分归因于文本的离散性质,部分归因于确保对抗样本仍然合理且可解释的问题,还有部分归因于在输入扰动下保持标签不变的问题。为应对其中一些挑战,我们提出稀疏投影梯度下降(SPGD),一种用于构造文本可解释对抗样本的新方法。SPGD通过将输入扰动投影到具有最高余弦相似度的邻近词嵌入的方向上,对输入扰动施加方向正则化约束。该约束确保扰动将每个词嵌入沿可解释的方向移动(即朝向另一个邻近词嵌入)。此外,SPGD通过在句子级别忽略范数低于某一阈值的词嵌入扰动,对扰动施加稀疏性约束。该约束确保我们的方法每条序列仅改变少数词,从而产生更高质量的对抗样本。我们在 IMDB 影评数据集上的实验表明,与最先进的方法相比,所提出的 SPGD 方法在牺牲极少甚至无训练性能损失的情况下,提升了对抗样本的可解释性与似然性(以平均逐词困惑度评估)。
引用
@article{arxiv.1905.12864,
title = {Interpretable Adversarial Training for Text},
author = {Samuel Barham and Soheil Feizi},
journal= {arXiv preprint arXiv:1905.12864},
year = {2019}
}