面向中文有毒攻击的隐式强化与混淆改写
计算与语言
2026-05-22 v1
摘要
大型语言模型(LLM)需要超越显性措辞的鲁棒毒性评估。这种设置在中文语境中尚未得到充分探索,因为中文毒性可能同时包含语义的隐晦性与表面混淆性。我们提出中文隐式毒性攻击框架(Chinese Implicit Toxicity Attack, CITA),该框架旨在进行受控的红队评估与防御数据生成,绝非可部署的规避工具。CITA包含三个阶段:(i)有害意图学习,(ii)隐式毒性强化,(iii)混淆变体改写,以保留有害意图、增加隐式性并引入受控的表面变体。我们在CITA生成的评估样本上测试了七个检测器,平均ASR达69.48%,显示出显著的漏检风险;人类评估进一步确认有害性得以保留且隐式性与规避性提升。作为下游防御应用,我们使用CITA生成的红队数据微调中文隐式毒性防御模型(Chinese Implicit Toxicity Defense, CITD),结果表明此类数据可通过额外训练提升鲁棒性。
引用
@article{arxiv.2605.22258,
title = {Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting},
author = {Jingyi Kang and Junyu Lu and Bo Xu and Hongbo Wang and Linlin zong and Roy Ka-Wei Lee and Hongfei Lin},
journal= {arXiv preprint arXiv:2605.22258},
year = {2026}
}
备注
16 pages, 5 figures