迷失于翻译:生成对往返翻译鲁棒的对抗样本
计算与语言
2023-07-25 v1 机器学习
摘要
当今的语言模型在大量下游任务上提供了很高的准确率。然而,它们仍然易受对抗攻击,尤其是那些对抗样本与原始文本保持相当相似性的攻击。鉴于文本的多语言特性,对抗样本在翻译间的有效性以及机器翻译如何提升对抗样本的鲁棒性在很大程度上仍未被探索。本文中,我们对当前文本对抗攻击针对往返翻译的鲁棒性进行了全面研究。我们证明6种最先进的基于文本的对抗攻击在往返翻译后不再保持其效力。此外,我们引入了一种基于干预的解决方案,通过将机器翻译整合进对抗样本生成过程,并展示出对往返翻译增强的鲁棒性。我们的结果表明,寻找对翻译鲁棒的对抗样本有助于识别语言模型跨语言普遍存在的不足,并激励对多语言对抗攻击的进一步研究。
引用
@article{arxiv.2307.12520,
title = {Lost In Translation: Generating Adversarial Examples Robust to Round-Trip Translation},
author = {Neel Bhandari and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2307.12520},
year = {2023}
}
备注
Published at International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2023