更具挑战性的文本,更智能的模型:提升对抗性防御基准的标准
计算与语言
2025-01-23 v2 人工智能
摘要
近期自然语言处理领域的进展凸显了深度学习模型易受对抗攻击的脆弱性。尽管提出了各种防御机制,但缺乏能够跨越多样化数据集、模型和任务,对这些防御进行全面评估的基准。本文通过构建一个广泛的文本对抗性防御基准,显著扩展了前期工作的范围。该基准包含广泛的数据集,评估了最先进的防御机制,并将评估范围扩展到包括单句子分类、相似性和改写识别、自然语言推理以及常识推理等关键任务。这一工作不仅为该领域的研究者和实践者提供了宝贵资源,还识别了文本对抗性防御领域的关键未来研究方向。通过建立该领域新的基准标准,旨在加速向更具鲁棒性和可靠性的自然语言处理系统迈进。
引用
@article{arxiv.2501.02654,
title = {Tougher Text, Smarter Models: Raising the Bar for Adversarial Defence Benchmarks},
author = {Yang Wang and Chenghua Lin},
journal= {arXiv preprint arXiv:2501.02654},
year = {2025}
}
备注
Will be presented as an oral in-person presentation at the conference of COLING 2025