CERT-ED:基于编辑距离的可证书鲁棒文本分类
计算与语言
2024-08-02 v1 密码学与安全
机器学习
摘要
随着 AI 在日常生活中的广泛应用,确保系统对推断时攻击的鲁棒性至关重要。在证明对此类对抗样本鲁棒性的方法中,随机平滑方法因其作为包裹在任意黑箱模型上的方式,已成为极具前景的方案。先前的自然语言处理领域中关于随机平滑的工作主要聚焦于特定的编辑距离操作子集,如同义词替换或单词插入,未涵盖所有编辑操作的认证。在本文中,我们采用了 Huang 等人 (2023) 所提出的随机删除方法,并提出了 CERTified Edit Distance 防御方案 (CERT-ED) 用于自然语言分类。通过全面实验,我们展示 CERT-ED 在 4 个数据集上在准确率和证书基数两个方面均优于现有的 Hamming 距离方法 RanMASK (Zeng 等,2023)。在涵盖 5 种直接攻击和 5 种迁移攻击等多种威胁模型下,我们的方法在 38 个情景中提升了经验鲁棒性。
引用
@article{arxiv.2408.00728,
title = {CERT-ED: Certifiably Robust Text Classification for Edit Distance},
author = {Zhuoqun Huang and Neil G Marchant and Olga Ohrimenko and Benjamin I. P. Rubinstein},
journal= {arXiv preprint arXiv:2408.00728},
year = {2024}
}
备注
22 pages, 3 figures, 12 tables. Include 11 pages of appendices