双重扰动:关于鲁棒性与反事实偏差评估的稳健性研究
计算与语言
2021-04-13 v1 计算机与社会
机器学习
摘要
鲁棒性和反事实偏差通常在测试数据集上评估。然而,这些评估本身是否稳健?如果测试数据集被轻微扰动,评估结果会保持不变吗?本文提出一种“双重扰动”框架,以揭示测试数据集之外的模型弱点。该框架首先扰动测试数据集以构建大量与测试数据相似的自然句子,然后诊断关于单字替换的预测变化。我们应用该框架研究两种基于扰动的、用于分析英语模型鲁棒性和反事实偏差的方法。(1)对于鲁棒性,我们关注同义替换并识别预测可被改变的不稳定样本。我们提出的攻击在原始及鲁棒训练的CNN和Transformer上均以高成功率(96.0%–99.8%)找到了不稳定样本。(2)对于反事实偏差,我们关注替换人口统计标记(如性别、种族)并衡量所构建句子间期望预测的变化。我们的方法能够揭示测试数据集中未直接显示的隐藏模型偏差。我们的代码见 https://github.com/chong-z/nlp-second-order-attack。
引用
@article{arxiv.2104.05232,
title = {Double Perturbation: On the Robustness of Robustness and Counterfactual Bias Evaluation},
author = {Chong Zhang and Jieyu Zhao and Huan Zhang and Kai-Wei Chang and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2104.05232},
year = {2021}
}
备注
NAACL 2021