DINA:针对自然语言处理中的内部噪声与外部攻击的双重防御框架
密码学与安全
2025-08-11 v1 计算与语言
摘要
随着大型语言模型(LLM)和生成式 AI 在客户服务和内容 moderation 应用中日益集成,来自外部操纵和内部标签损坏的对抗威胁日益增长。在本工作中,我们识别并系统性地解决这些双重对抗威胁,提出了 DINA(Dual Defense Against Internal Noise and Adversarial Attacks),这是一套专为 NLP 设计的新型统一框架。我们的方法采用计算机视觉中先进的带噪标签学习方法,并将其与对抗训练相结合,以同时缓解内部标签破坏和外部对抗扰动。在来自线上游戏服务的真实数据集上进行的大规模实验表明,DINA 相对于基线模型显著提高了模型的鲁棒性和准确性。我们的发现不仅凸显了双重威胁防御的关键必要性,也为在现实对抗情景中保护 NLP 系统提供了实用策略,进而彰显了更广泛的公平负责任 AI 部署的意义。
引用
@article{arxiv.2508.05671,
title = {DINA: A Dual Defense Framework Against Internal Noise and External Attacks in Natural Language Processing},
author = {Ko-Wei Chuang and Hen-Hsen Huang and Tsai-Yen Li},
journal= {arXiv preprint arXiv:2508.05671},
year = {2025}
}
备注
7 pages