RTD-Guard:基于替换标记检测的数据驱动文本对抗样本检测框架
计算与语言
2026-03-16 v1 密码学与安全
摘要
文本对抗攻击通过引入难以察觉的扰动来误导深度学习模型,对自然语言处理(NLP)系统构成严重的安全威胁。虽然对抗样本检测提供了一种轻量级的鲁棒训练替代方案,但现有方法通常依赖对攻击的先验知识、对受害模型的白盒访问,或大量查询,严重限制了其实际部署。本文介绍 RTD-Guard,一种用于检测文本对抗样本的全新黑箱框架。我们的关键洞察是,文本对抗攻击中的词替换扰动与替换标记检测(Replaced Token Detection, RTD)判别器预训练识别的“被替换标记”高度相似。基于此,RTD-Guard 采用即插即用的 RTD 判别器——无需微调——来定位可疑标记,随后遮蔽这些标记,通过观察受害模型在干预前后的预测置信度变化来检测对抗样本。整个过程无需对抗数据、模型调优或内部模型访问,仅需两个黑箱查询。多项基准实验表明,RTD-Guard 有效检测了由多种最新攻击方法生成的对抗文本。它在多个指标上超越了现有检测基线,提供了一种高效、实用且资源密集型的防御机制,特别适合在资源受限或隐私敏感的环境中部署。
引用
@article{arxiv.2603.12582,
title = {RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection},
author = {He Zhu and Yanshu Li and Wen Liu and Haitian Yang},
journal= {arXiv preprint arXiv:2603.12582},
year = {2026}
}
备注
15 pages, 4 figures