逐步损失大有可为:面向对抗性文本攻击的多步量化
计算与语言
2023-02-13 v1
摘要
我们提出一种针对基于 Transformer 的语言模型的新型基于梯度的攻击,该攻击在词元概率的连续空间中搜索对抗样本。我们的算法通过在量化-补偿循环中执行多步量化,缓解了连续与离散文本表示之间对抗损失的差隙。实验表明,我们的方法在各种自然语言处理(NLP)任务上显著优于其他方法。
引用
@article{arxiv.2302.05120,
title = {Step by Step Loss Goes Very Far: Multi-Step Quantization for Adversarial Text Attacks},
author = {Piotr Gaiński and Klaudia Bałazy},
journal= {arXiv preprint arXiv:2302.05120},
year = {2023}
}