中文

ToxiGAN:基于LLM引导的有毒数据增强通过方向性对抗生成

计算与语言 2026-01-07 v1 人工智能 机器学习

摘要

以可控且类别特定的方式增强有毒语言数据对于提高有毒分类器的鲁棒性至关重要,但由于监督有限和分布偏斜,仍面临挑战。我们提出ToxiGAN,一个结合对抗生成与大语言模型(LLM)语义指导的类别感知文本增强框架。为解决GAN-based增强中常见的模式崩溃和语义漂移问题,ToxiGAN引入了两步方向性训练策略,并利用LLM生成的中性文本作为语义支撑。不同于以往将LLM视为静态生成器的做法,我们的方法动态选择中性示例以提供均衡指导。 toxic样本被显式优化以与这些示例产生偏离,从而强化类别特定的对比信号。在四个仇恨言语基准测试上进行的实验表明,ToxiGAN在macro-F1和hate-F1指标上均实现最佳平均性能,持续优于传统和基于LLM的增强方法。消融和灵敏度分析进一步确认了语义支撑和方向性训练在增强分类器鲁棒性方面的优势。

关键词

引用

@article{arxiv.2601.03121,
  title  = {ToxiGAN: Toxic Data Augmentation via LLM-Guided Directional Adversarial Generation},
  author = {Peiran Li and Jan Fillies and Adrian Paschke},
  journal= {arXiv preprint arXiv:2601.03121},
  year   = {2026}
}

备注

This paper has been accepted to the main conference of EACL 2026