中文

destroR:针对转移模型的混淆式对抗攻击以抛弃困惑度

计算与语言 2025-11-17 v1

摘要

近年来,机器学习与神经网络的快速发展推动了自然语言处理在多个领域的广泛应用,取得了惊人的成功,解决了各种复杂问题。然而,近期研究表明,机器学习模型可能以多种方式脆弱,这既危及模型本身,也危及其所依赖的系统。在本文中,我们旨在分析和实验现有最佳对抗攻击方法,并开发新方法。我们集中注意力开发一种针对当前最先进机器学习模型的新型对抗攻击策略,通过产生模糊输入来混淆模型,然后构建模型鲁棒性未来发展的路径。我们将开发最大困惑度的对抗实例,利用机器学习和深度学习方法欺骗模型。在我们的攻击配方中,我们将分析多个数据集,专注于创建混淆式对抗样本,使模型处于困惑状态,并通过包括孟加拉语言在对抗攻击领域。我们严格遵守效用使用减少和效率原则。

关键词

引用

@article{arxiv.2511.11309,
  title  = {destroR: Attacking Transfer Models with Obfuscous Examples to Discard Perplexity},
  author = {Saadat Rafid Ahmed and Rubayet Shareen and Radoan Sharkar and Nazia Hossain and Mansur Mahi and Farig Yousuf Sadeque},
  journal= {arXiv preprint arXiv:2511.11309},
  year   = {2025}
}

备注

9 pages, 2 figures, 6 Table