人在回路的对抗文本生成:以藏文为例的案例研究
计算与语言
2025-11-18 v5 密码学与安全
人机交互
摘要
基于深度神经网络(DNN)的语言模型在各种自然语言处理(NLP)任务中表现优异,但仍极易受到文本对抗攻击的威胁。尽管对抗文本生成对 NLP 的安全性、可解释性、评估和数据增强至关重要,但相关工作仍 overwhelmingly 以英语为中心,使得为低资源语言构建高质量且可持续的对抗鲁棒性基准这一难题既困难重重又缺乏研究。首先,由于语言差异和资源有限,针对低资源语言的方法定制变得复杂。其次,自动化攻击容易生成无效或语义模糊的对抗文本。最后,语言模型不断演进,可能会对先前生成的部分对抗文本免疫。为应对这些挑战,我们引入了 HITL-GAT,这是一个基于人在回路对抗文本生成通用方法的交互式系统。此外,我们通过以藏文为例的案例研究展示了 HITL-GAT 的实用性,采用了三种定制的对抗文本生成方法并建立了其首个对抗鲁棒性基准,为其他低资源语言提供了有价值的参考。
引用
@article{arxiv.2412.12478,
title = {Human-in-the-Loop Generation of Adversarial Texts: A Case Study on Tibetan Script},
author = {Xi Cao and Yuan Sun and Jiajun Li and Quzong Gesang and Nuo Qun and Tashi Nyima},
journal= {arXiv preprint arXiv:2412.12478},
year = {2025}
}
备注
Camera-Ready Version; Accepted at IJCNLP-AACL 2025 Demo