几何至关重要:在决策边界探索语言样本
计算与语言
2021-10-29 v3 机器学习
摘要
近期越来越多的证据凸显了自然语言处理(NLP)数据集与分类器的局限。这些局限包括数据集中存在标注伪迹、分类器依赖浅层特征(如单个词,若影评含“romantic”则倾向正面)或无关词(如学习专有名词来将电影分类为正或负)。此类伪迹的存在随后催生了具有挑战性的数据集以迫使模型更好地泛化。尽管已提出反事实样本、对比集等多种启发式策略,但关于何种原因使这些样本对分类器困难的理论依据常常缺失或不清晰。本文中,我们利用信息几何工具,提出一种量化 NLP 样本难度的理论方法。借助该方法,我们探索了若干深度学习架构的困难样本。我们发现 BERT、CNN 与 fasttext 均易受高难度样本中词语替换的影响。这些分类器在 FIM 测试集上表现不佳(通过采样与扰动困难样本生成,准确率降至 50% 以下)。我们在 5 个 NLP 数据集(YelpReviewPolarity、AGNEWS、SogouNews、YelpReviewFull 与 Yahoo Answers)上复现实验。在 YelpReviewPolarity 上,我们观察到对扰动的鲁棒性与难度分数间相关系数为 -0.4。类似地,难度分数与随机替换的经验成功概率间相关系数为 0.35。我们的方法简单、架构无关,可用于研究文本分类模型的脆弱性。所用代码将公开,包括一个用于探索其他数据集困难样本的工具。
引用
@article{arxiv.2010.07212,
title = {Geometry matters: Exploring language examples at the decision boundary},
author = {Debajyoti Datta and Shashwat Kumar and Laura Barnes and Tom Fletcher},
journal= {arXiv preprint arXiv:2010.07212},
year = {2021}
}
备注
Ongoing Work, Presented at TADA 2021