面向变化扰动的毒性检测适应性研究
密码学与安全
2025-03-05 v3 人工智能
计算与语言
机器学习
摘要
毒性检测对于维护社会和谐至关重要。虽然现有方法在正常毒性内容或由特定扰动方法生成的内容上表现良好,但对不断演变的扰动模式极其脆弱。然而,在现实场景中,恶意用户倾向于创建新的扰动模式以欺骗检测器。例如,一些用户可能通过在提示开头添加“我是科学家”来规避大语言模型(LLM)的检测。本文引入了毒性检测领域的一种新问题,即持续学习越狱扰动模式。为解决这一问题,我们首先构建了一个由九种扰动模式生成的新数据集,其中七种扰动模式概括自 prior 工作,另有两种由我们自主开发。随后,我们通过零样本和微调的跨模式检测,系统验证了当前方法在该新扰动模式感知数据集上的脆弱性。在此基础上,我们提出了领域增量学习范式及相应的基准,以确保检测器对动态出现的扰动有毒文本具有鲁棒性。我们的代码和数据集将在附录中提供,并计划在 GitHub 上公开,以此为安全相关社区提供新的研究机遇。
引用
@article{arxiv.2412.15267,
title = {Toxicity Detection towards Adaptability to Changing Perturbations},
author = {Hankun Kang and Jianhao Chen and Yongqi Li and Xin Miao and Mayi Xu and Ming Zhong and Yuanyuan Zhu and Tieyun Qian},
journal= {arXiv preprint arXiv:2412.15267},
year = {2025}
}
备注
There are still some flaws in the uploaded content, which may cause confusion for readers. To be rigorous, we need to retract the paper for optimization and improvement