文本分类器中的对抗攻击与维度
机器学习
2024-04-04 v1
摘要
机器学习算法上的对抗攻击一直是阻碍人工智能在许多实际用例中应用的关键因素。它们通过强制错误分类,显著削弱了高性能神经网络的能力。这些攻击在测试样本中引入微小且结构化的扰动或改变,通常人类标注者无法察觉,但训练好的神经网络和其他模型对其敏感。历史上,对抗攻击首先在图像处理领域被识别和研究。在本文中,我们研究自然语言处理领域中的对抗样本,特别是文本分类任务。我们调查了对抗脆弱性的原因,特别是与模型固有维度的关系。我们的关键发现是,对抗样本的嵌入维度与其对使用相同嵌入维度的输入样本调优的模型的有效性之间存在非常强的相关性。我们利用这种敏感性设计了一种对抗防御机制。我们使用不同固有维度的集成模型来抵御攻击。在多个数据集上测试了其提供鲁棒性的有效性。我们还研究了使用不同距离度量测量对抗扰动的问题。对于上述所有研究,我们在多个不同维度的模型上进行了测试,并使用词向量级别的对抗攻击来证实发现。
引用
@article{arxiv.2404.02660,
title = {Adversarial Attacks and Dimensionality in Text Classifiers},
author = {Nandish Chattopadhyay and Atreya Goswami and Anupam Chattopadhyay},
journal= {arXiv preprint arXiv:2404.02660},
year = {2024}
}
备注
This paper is accepted for publication at EURASIP Journal on Information Security in 2024