解构 SNLI 矛盾示例对攻击的韧性
计算与语言
2024-12-17 v1
摘要
预训练模型在 NLI 基准测试(如 SNLI 和 MultiNLI)中表现出色,但其真正的语言理解是否值得怀疑。仅使用假设和标签训练的模型获得高准确率,表明模型依赖于数据集偏差和虚假关联。为探索这一问题,我们应用了通用对抗攻击来检查模型的脆弱性。我们的分析显示,针对包含矛盾类的样本,模型准确率下降幅度较小,而针对包含包含和中性类的样本,准确率下降显著。通过在对抗样本数据集上微调模型,可将其在标准数据集和挑战数据集上的性能恢复到接近基准水平。我们的发现凸显了对抗触发器在识别虚假关联和提高韧性方面的价值,同时为分析矛盾类对抗攻击的韧性提供了洞见。
引用
@article{arxiv.2412.11172,
title = {Unpacking the Resilience of SNLI Contradiction Examples to Attacks},
author = {Chetan Verma and Archit Agarwal},
journal= {arXiv preprint arXiv:2412.11172},
year = {2024}
}