中文

文本分类中分布外样本与对抗样本的区分、检测与分离

计算与语言 2022-04-12 v1

摘要

本文中,我们研究统计分布外(OOD)样本与对抗(Adv)样本之间的差异与共性,二者均会损害文本分类模型的性能。我们从三个方面对两类异常(OOD 与 Adv 样本)与分布内(ID)样本进行比较分析:输入特征、模型各层的隐藏表示,以及分类器的输出概率分布。我们发现 OOD 样本从第一层起就暴露其异常,而 Adv 样本的异常直到模型更深层才显现。我们还说明,模型对 Adv 样本的输出概率往往更不自信。基于观察,我们提出一种简单方法,利用模型的隐藏表示与输出概率来分离 ID、OOD 与 Adv 样本。在多个 ID、OOD 数据集与 Adv 攻击的组合上,我们所提方法在区分 ID、OOD 与 Adv 样本方面展现出优异结果。

关键词

引用

@article{arxiv.2204.04458,
  title  = {Understanding, Detecting, and Separating Out-of-Distribution Samples and Adversarial Samples in Text Classification},
  author = {Cheng-Han Chiang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2204.04458},
  year   = {2022}
}

备注

Preprint. Work in progress