基于深度学习的文本分类算法对实际输入扰动的敏感性研究
计算与语言
2022-07-08 v2 机器学习
摘要
文本分类是一项基础的自然语言处理任务,具有广泛应用,其中深度学习方法已产生最先进的结果。尽管这些模型因其黑盒性质受到大量批评,它们对输入文本中轻微扰动的鲁棒性一直备受关注。本工作中,我们开展了一项以数据为中心的研究,评估系统性实际扰动对基于深度学习的文本分类模型(如 CNN、LSTM 和基于 BERT 的算法)性能的影响。扰动由添加和移除与模型最终性能关联极小的非必要词元(如标点和停用词)引起。我们表明这些深度学习方法包括 BERT 在四个标准基准数据集 SST2、TREC-6、BBC News 和 tweet_eval 上对此类合法输入扰动敏感。我们观察到与添加词元相比,BERT 对移除词元更易感。此外,与基于 CNN 的模型相比,LSTM 对输入扰动稍更敏感。该工作亦可作为评估训练-测试条件差异对模型最终性能影响的实际指南。
引用
@article{arxiv.2201.00318,
title = {On Sensitivity of Deep Learning Based Text Classification Algorithms to Practical Input Perturbations},
author = {Aamir Miyajiwala and Arnav Ladkat and Samiksha Jagadale and Raviraj Joshi},
journal= {arXiv preprint arXiv:2201.00318},
year = {2022}
}
备注
Accepted at Computing Conference 2022